Agent组队干活,最强模型只完成50%任务!基准评测协作能力

AITNT-国内领先的一站式人工智能新闻资讯网站
# 热门搜索 #
Agent组队干活,最强模型只完成50%任务!基准评测协作能力
7231点击    2026-10-10 12:29

个体能力强大的AI Agent正不断涌现。从编写代码、开发软件,到检索文献、辅助科学研究,它们能独立完成的工作越来越多。


但随着这些「超级个体」变得更强,一个同样重要的问题也浮现出来:它们能否合作?


回看人类社会,许多复杂成就都依赖一群人的分工与协作。假如我们要组建一家公司,制造火箭、登上月球,首先要考虑的,恐怕不是寻找一个无所不能的天才,而是如何组织一支团队:需要哪些专业人才,怎样分工,如何共享信息,又如何让不同环节的工作衔接起来。


从科学发现到大型工程,个体能力固然重要,组织和协作也决定了我们能够走多远。


这让我们开始思考:当大模型和Agent的个体能力持续增强时,它们的协作能力发展到了什么程度?面对一个共同目标,它们会不会主动交换信息、协调分工?当多个智能体一起工作时,能否真正发挥各自的优势,让复杂任务更容易完成?


带着这些问题,OpenAgents、哥伦比亚大学、宾夕法尼亚大学、首尔大学和宾夕法尼亚州立大学的研究者共同构建了AgentWorld:一个面向多智能体协作能力的评测基准(benchmark)。


Agent组队干活,最强模型只完成50%任务!基准评测协作能力


论文链接:https://arxiv.org/abs/2609.31590


项目网站:https://agentworld.io/


代码与数据:https://github.com/openagents-org/agentworld


研究团队关心的是:当多个智能体拥有不同的角色、能力和资源,并需要共同完成一项任务时,它们能否形成有效的分工、保持信息同步,并把各自的行动连接起来,最终实现共同目标。


AgentWorld又补上了什么?


近年来,科研界已经在探索让多个大模型通过对话、角色分工和相互反馈共同解决问题,也提出了面向协作的评测任务,以及游戏和社会模拟环境。


随着这些研究推进,一个需要进一步回答的问题是:当任务持续数十轮、成员掌握不同资源,而且每一步都可能影响队友时,团队能否持续保持有效协作?


AgentWorld 的特色,在于把长时程任务、角色不对称和黑盒交互结合到同一个协作评测环境中。


高层工具减少了导航、操作等低层控制的干扰,程序化规则检查共同目标是否完成;进一步提出的CCE指标,则追溯哪些行动和消息被判定为对结果有贡献。这样,评测既能观察团队是否成功,也能分析跨角色的交接与配合如何促成成功。


AgentWorld简介


一支由10个智能体组成的团队,进入了一个角色扮演游戏(RPG)世界。


想象这样一个任务:给队伍里的法师做一根魔法杖。伐木工负责采集木材,木工把木材加工成木棒,法师再用木棒和自己持有的材料完成制作。看上去,只要各司其职就行。


但真正执行起来,问题可能出在任何一次交接:木材该交给谁?木棒准备好了没有?队友已经完成的步骤,还要不要重复做?任务尚未完成时,有没有人提前宣布「收工」?


这些问题,正是多智能体协作系统需要面对的考验。


AgentWorld是一个面向Agent协作能力的评测基准(benchmark):让多个由大语言模型驱动的智能体,在同一个持续变化的环境中分工、沟通、共享资源,并共同完成任务。


在论文报告的四个主模型实验中,主任务集上的最高成功率为52.0%。这个结果提出了一个值得研究的问题:当单个Agent的能力不断提升,团队层面的协作还缺少什么?


Agent组队干活,最强模型只完成50%任务!基准评测协作能力


图 1|AgentWorld 环境示例:不同角色拥有各自的视角,通过游戏内聊天交流。截图展示一个十智能体团队,不对应下文的三智能体魔法杖任务。


把「会协作」变成可以测量的能力


「多个Agent参与」是一种系统结构,「多个Agent有效协作」则是一种需要验证的能力。


如果只是让几个模型分别回答问题,再汇总答案,我们仍然很难知道:它们能否理解彼此的职责,能否在资源不足时调整分工,又能否根据队友的最新进展修改计划。


AgentWorld把这些问题放进了一个MMORPG沙盒,也就是多人在线角色扮演游戏环境。这里有可采集的资源、可制作的物品、需要应对的敌人,以及不同位置上的队友。智能体的行动会改变环境,也会影响其他成员下一步能做什么。


游戏提供了可执行、可观察的协作场景;评测关注的是团队能否把共同目标推进到完成。


论文介绍的任务集由100个人工设计任务和100个增强变体组成,涵盖战斗、制作、采集、交易、探索、生存、建造和协调等类型。任务需要3至20个智能体参与,许多任务包含连续的资源交接与行动依赖。


这一设计把协作从一段听起来合理的对话,变成了一串必须真正发生的动作。


三个设计


让协作难题显现出来


首先是角色不对称。不同智能体拥有不同技能、物品和初始条件。队伍需要根据这些差异安排工作,而不是让所有成员执行同一套动作。


在魔法杖任务中,伐木、加工、制作形成一条依赖链。即使每个成员都知道最终目标,团队仍然需要解决「谁先做、交给谁、什么时候交」的问题。


Agent组队干活,最强模型只完成50%任务!基准评测协作能力


图 2|另一个任务示例:十名智能体承担采矿、冶炼、锻造、支援和协调等职责,共同完成物品制作目标。角色配置使分工与资源传递成为任务的一部分。


其次是黑盒交互。智能体不能直接读取队友的内部推理状态。它需要通过环境观察、聊天和行动结果,判断其他成员在做什么。这让「我以为队友已经做完了」成为真实的失败来源。


第三是多轮执行。一份开局计划无法覆盖所有后续变化。队伍必须在执行中持续更新状态:资源是否到位、队友是否需要支援、原先的分工是否仍然有效。论文中的主任务设置了数十轮的执行预算,要求智能体在多次交接中保持协调。


为了减少低层操作的干扰,AgentWorld 提供了 13 个高层 API 工具。例如,采集或攻击工具可以封装导航和具体执行流程,让模型把更多决策放在「下一步做什么」和「与谁配合」上。


这并不意味着评测完全排除了规划和工具使用的影响,但它让协作问题更容易被观察和分析。


最好的团队完成约一半任务


聊天更多也未必更好


研究在统一的提示模板、工具定义和交互协议下,评测了 Gemini 3 Flash、Claude Haiku 4.5、GPT-5 Mini 和 DeepSeek R1-70B。


主任务集上,四个模型的任务成功率分别为 52.0%、45.0%、36.0% 和 20.0%。在增强任务集上,对应成功率为 24.0%、26.0%、21.0% 和 10.0%。


Agent组队干活,最强模型只完成50%任务!基准评测协作能力


图 3|按照论文主结果表重绘。这里比较的是各模型驱动的团队,在论文指定设置下的表现;不代表对所有Agent系统设计的能力上限判断。


值得注意的还有「做到一部分」和「真正做完」之间的差距。Gemini 3 Flash 在主任务集上的部分成功率为71.5%,完整任务成功率为52.0%。团队推进了一些中间目标,并不保证最后的资源交接或制作步骤能够完成。


通信量也没有呈现「越多越好」的简单关系。GPT-5 Mini平均每个主任务发送44.1条聊天消息,但成功率为36.0%;Gemini 3 Flash平均发送11.0条,成功率为52.0%。


这组结果并不能证明少聊天会提升成功率,但它提醒我们:消息数量无法直接替代协作质量。


更值得关注的是,一条消息是否更新了有效信息,是否消除了分工歧义,以及接收方是否据此采取了行动。


完成任务之外,还要追问:哪些行动帮上了忙?


只统计成功率,还不足以描述团队的工作方式。


两个团队都完成了任务,其中一个分工明确、交接顺畅,另一个经历了大量重复采集、无效等待和信息误解。如果只看最终结果,两者会得到相同的成功标签。


为此,论文提出了Causal Collaboration Effectiveness(CCE,因果协作有效性)。


它从团队最终完成的目标往回看,计算有多少行动被判定为推动了这个结果。


成功率回答的是「团队有没有把事情做成」,CCE则进一步追问「在做成这件事的过程中,哪些行动帮上了忙」。它关注的贡献不限于最后完成任务的那一步,也包括为后续行动提供材料、条件或有效信息的准备工作。


它从完成目标的动作开始,沿时间向前回溯:这次制作依赖哪些材料?材料来自哪次转移?转移又依赖谁的采集或加工?算法借助大语言模型,对候选动作之间的因果依赖作出判断,逐步构建行动关系图。


Agent组队干活,最强模型只完成50%任务!基准评测协作能力


图 4|论文中的CCE示意图:伐木工、木工和法师的行动通过跨角色依赖相连。图中 12/27 是这条示意轨迹的贡献动作占比,不是整个数据集的平均结果。


计算方式并不复杂:


成功任务的 CCE = 被判定为对成功有贡献的动作数 ÷ 团队执行的总动作数。


以图4的示意轨迹为例,三个智能体一共执行了27个动作,其中12个被纳入通向任务成功的贡献链,因此CCE = 12 ÷ 27 ≈ 44.4%。


法师制作魔法杖是直接完成目标的动作;伐木工采集和转交木材、木工加工和交付木棒,则可能通过后续依赖间接促成成功。


聊天也可能成为有贡献的动作。如果一条消息提供了后续行动所依赖的信息,它就有可能进入这条贡献链;是否计入取决于具体轨迹和判断规则,而不是只看它属于「聊天」还是「工具调用」。


论文将失败任务的CCE按定义记为0。这是指标的计分约定,并不意味着失败过程中的每次尝试都毫无价值。


因此,跨任务平均CCE同时受到成功率和成功轨迹中贡献动作比例的影响。它应与成功率、部分成功率结合阅读,而不宜被当作一个独立的「团队默契分」。


这里需要区分两个概念:平均每个任务的动作占比,不等于把所有任务动作汇总后计算出的总体占比。 也不能把没有被回溯为成功贡献的动作,一概理解为毫无意义;必要探索、信息不足下的尝试,以及判断误差都需要考虑。


CCE的价值在于提供一个可检查的分析视角,帮助研究者追问团队的工作过程。它仍依赖模型判断,也不能单独证明一套系统已经具备通用协作能力。


从重复劳动到提前收工


失败发生在协作细节里


论文对通信轨迹的分析归纳出多类失败:重复询问已经解决的问题、认错角色或资源接收者、报告错误的物品信息,以及在关键步骤尚未完成时宣布任务结束。


这些现象说明,多Agent系统需要维护的不只是「任务计划」,还有不断变化的团队状态。


对系统开发者而言,AgentWorld提供了进一步实验的场景:明确的角色分工能否减少误解?共享记忆能否帮助队伍同步进展?集中规划和分布执行各有什么优势?新的通信机制究竟提高了完成率,还是只增加了消息量?


这些都应通过对照实验回答。一个协作benchmark的作用,就是让方法改进能够落在相同任务、相同规则和可复查的执行记录上。


从「各自能干」走向「共同完成」


AgentWorld 的实验还不足以把协作困难归结为所有大模型的普遍上限。结果对应特定模型、提示、工具接口和执行协议,更丰富的规划、记忆或通信设计仍有探索空间。


但它把一个重要问题具体化了:衡量Agent团队,既要看成员能做什么,也要看它们能否在彼此依赖的条件下,共同把事情做完。


随着多智能体系统被用于更复杂的工作流程,对协作能力的评测也需要从对话质量延伸到实际行动。AgentWorld 为这种评测提供了一个可运行、可比较的实验环境。


参考资料:


https://arxiv.org/abs/2609.31590



文章来自于微信公众号 “新智元”,作者 “新智元”

AI转型,免费服务,就找AITNT
AITNT资源拓展
根据文章内容,系统为您匹配了更有价值的资源信息。内容由AI生成,仅供参考
1
AI代理

【开源免费】Browser-use 是一个用户AI代理直接可以控制浏览器的工具。它能够让AI 自动执行浏览器中的各种任务,如比较价格、添加购物车、回复各种社交媒体等。

项目地址:https://github.com/browser-use/browser-use


2
AI工作流

【开源免费】字节工作流产品扣子两大核心业务:Coze Studio(扣子开发平台)和 Coze Loop(扣子罗盘)全面开源,而且采用的是 Apache 2.0 许可证,支持商用!

项目地址:https://github.com/coze-dev/coze-studio


【开源免费】n8n是一个可以自定义工作流的AI项目,它提供了200个工作节点来帮助用户实现工作流的编排。

项目地址:https://github.com/n8n-io/n8n

在线使用:https://n8n.io/(付费)


【开源免费】DB-GPT是一个AI原生数据应用开发框架,它提供开发多模型管理(SMMF)、Text2SQL效果优化、RAG框架以及优化、Multi-Agents框架协作、AWEL(智能体工作流编排)等多种技术能力,让围绕数据库构建大模型应用更简单、更方便。

项目地址:https://github.com/eosphoros-ai/DB-GPT?tab=readme-ov-file



【开源免费】VectorVein是一个不需要任何编程基础,任何人都能用的AI工作流编辑工具。你可以将复杂的工作分解成多个步骤,并通过VectorVein固定并让AI依次完成。VectorVein是字节coze的平替产品。

项目地址:https://github.com/AndersonBY/vector-vein?tab=readme-ov-file

在线使用:https://vectorvein.ai/(付费)

3
智能体

【开源免费】AutoGPT是一个允许用户创建和运行智能体的(AI Agents)项目。用户创建的智能体能够自动执行各种任务,从而让AI有步骤的去解决实际问题。

项目地址:https://github.com/Significant-Gravitas/AutoGPT


【开源免费】MetaGPT是一个“软件开发公司”的智能体项目,只需要输入一句话的老板需求,MetaGPT即可输出用户故事 / 竞品分析 / 需求 / 数据结构 / APIs / 文件等软件开发的相关内容。MetaGPT内置了各种AI角色,包括产品经理 / 架构师 / 项目经理 / 工程师,MetaGPT提供了一个精心调配的软件公司研发全过程的SOP。

项目地址:https://github.com/geekan/MetaGPT/blob/main/docs/README_CN.md