说一个反常识的真相,Agent如今在真实工作场景的成功率依然很低。

AITNT-国内领先的一站式人工智能新闻资讯网站
# 热门搜索 #
说一个反常识的真相,Agent如今在真实工作场景的成功率依然很低。
5985点击    2026-08-17 10:54

上周一,我发了自己做的AIHOT大模型排行榜。


有很多朋友感兴趣,在文章下面评论,最高赞的一条,是在问能不能有个分类测评,能够评估不同模型做不同任务的表现。


说一个反常识的真相,Agent如今在真实工作场景的成功率依然很低。


讲道理,这其实一直是我想做的,也是我觉得特别特别核心的痛点。


现在的大模型榜单很多,比如LiveBench、DeepSWE之类的,可以很快知道哪个模型在某一个能力维度上更强,像Coding、数学、浏览器操作等等。


但是有一类评测集,其实是最稀缺的。


就是模型在真实工作中的实际完成效果。


比如金融领域、法律领域、电商领域、生活领域等等等等,就是直接给它一份真实工作,让它自己从头干到尾,最终看工作效果,而这些,我觉得其实才更符合真实用户的日常工作和生活,也对大家更有用。


所以,在分类上,我一直想把这些场景给补上,把这个排行榜的维度,变得更加丰富和多维化。


于是,这个周末,我几乎把所有的评测集都翻了一遍,不翻不知道,一翻才吓一跳,这块的评测集,真的少的太可怜的,真的可以用寥寥无几来形容。


而且绝大多数的模型的跑分,在这些真实场景下任务的成功率,也是真的低的可怜,跟大家在Coding领域的体感完全不一样。


我用一个周末我翻到的比较成熟的电商评测的评测集来举例子,正好也是上周开源的,比较新,一些最新的模型也都有。


这个评测集叫RealReplicaBench,团队来自阿里国际站,因为他们就是做外贸的,所以内部的数据我觉得还是比较权威的,从这个案例,也可以看看Agent在真实的电商场景下能完成什么样子。


Github地址:https://github.com/Accio-org/RealReplicaBench


说一个反常识的真相,Agent如今在真实工作场景的成功率依然很低。


这套评测一共有107个任务,阿里国际站因为直接做了Accio Work这个电商Agent,然后他们就从大概过去160万条完整对话中整理出20万条工作流,再归纳出约2000条商业价值高的,最后按照可复现性和结果可判定性,最终整理出来107个任务。


说一个反常识的真相,Agent如今在真实工作场景的成功率依然很低。


基本把电商领域涉及到的工作场景都覆盖了,像供应商采购、商品发布、店铺经营、订单对账、国际物流、售后争议等等等等。


任务具体内容的分布我让GPT做了张图,方便大家更直观的看一下。


说一个反常识的真相,Agent如今在真实工作场景的成功率依然很低。


每一个,都是真实世界里面的电商任务。


简单看几个例子的案例,大家就知道大概都是什么样的任务了。


比如,有一个任务是让模型在店铺上上线一款定制瑜伽垫。


说一个反常识的真相,Agent如今在真实工作场景的成功率依然很低。


模型拿到的信息有发品计划、三家供应商的报价和一堆实拍图片。


然后呢,它要找出计划指定的供应商,填好类目、销售国家、差异定价和描述,再从一堆相机自动编号的照片里挑出正确、清晰的商品图上传。


还有一个,是给东莞到达拉斯的消费级电子产品规划运输路线。


说一个反常识的真相,Agent如今在真实工作场景的成功率依然很低。


在30天的运输时间的限制下,模型需要计算保险、清关、海关担保和平台费,找出总成本最低的路线,再在仿真的货代平台里完成海运段订舱和货件验证。


还有处理电商退货争议。


说一个反常识的真相,Agent如今在真实工作场景的成功率依然很低。


这个任务里面模型需要把订单记录、物流扫描、仓库质检、客户对话、现场照片、平台政策和截止时间全对起来,然后逐单决定接受退货、部分退款、全额退款、向平台申诉,还是继续补充证据。


甚至还有跨平台月度对账。


说一个反常识的真相,Agent如今在真实工作场景的成功率依然很低。


它要把天猫、京东、拼多多三套格式不同的原始订单清洗到一张表里,统一SKU和订单状态,核对发货与结算差异,再算出每个SKU在各个平台的收入、成本、佣金和利润,最后把这些信息按照指定格式进行交付。


从这几个例子就能看到,这基本都是现实世界的电商交易的真实任务,商品上架、物流规划,到售后和经营分析,基本全都有,而且讲道理,这些任务看着就是脏活累活,理论上都应该交给Agent干对吧。


然后呢,我们来看看,现在在Coding上感觉已经大杀四方,感觉什么都能干出来的这些牛逼模型,在这个真实任务场景上的成功率有多少。


说一个反常识的真相,Agent如今在真实工作场景的成功率依然很低。


这些模型,是在PI这个开源Harness框架下跑的,所以准确性我觉得没啥问题。


百分制下,只有排名第一的Claude Opus 5刚刚过了及格线。


107个任务,它完成了65个,通过率60.75%。


Qwen 3.8 Max和DeepSeek V4 Pro以49.53%的通过率并列第三。


也就是说,现在大部分模型的任务通过率甚至连50%都过不去,107个任务,你让AI去做,有一半是全失败的。


这就是现在的模型,在真实世界工作中,非常真实的现状。


我也详细看了看他们是怎么去衡量模型到底完没完成,以及给不给分的,看完以后,我感觉比我想象的还要复杂一些。


我随机挑一道供应商采购题,来给大家看看评测过程。


说一个反常识的真相,Agent如今在真实工作场景的成功率依然很低。


比如这个题,任务的主角Dana是一名采购经理。


她离开几天后回来,邮箱里已经堆了大约300封邮件。


但是呢,她有一个铝合金笔记本支架项目,必须在当天完成推进。


模型需要从这些邮件里还原项目相关的需求、最新的规格和数量,从20家供应商里找出真正合格、单件落地成本最低的一家。


选好供应商以后,它还需要进行一系列的规范化操作,比如只给最终选中的那封报价打标签,标出3封要求更换收款账户的可疑邮件,保存给供应商的回复草稿,创建启动会议,并交付一份规定格式的JSON总结。


这个任务量你想一想都知道有多大,而且这些任务的原始数据也非常乱,充分体现了现在人类的混乱性。


比如项目的最终需求零零碎碎的散在10封邮件里面,中途还改过数量,改过要求,改的乱七八糟的。


而且供应商也不是只看公司名,因为现实世界中,也经常会有同一家供应商会换着联系人、邮箱、域名和显示名称来发报价,所以题目中,同时还混进了4组名字很像、实际却是不同公司的供应商。


模型得综合工厂地址、电话、银行收款人和出口许可证等多个信号交叉核对,才能判断哪些报价来自同一家。


说实话,这个过程,看得我都要力竭了,至少我是一丁点都不想干的状态。。。


所以我也生了个页面,方便看得更清晰。


说一个反常识的真相,Agent如今在真实工作场景的成功率依然很低。


Accio Work团队那边,也给模型准备好了Shopify、Gmail、日历、商品发布之类的工具,可以让模型直接用。


等模型做完,评测程序会直接检查邮箱、草稿、日历和JSON文件的最终状态。


一共有23组、42项结果检查。


说一个反常识的真相,Agent如今在真实工作场景的成功率依然很低。


像选中的报价有没有加上正确的标签?3封钓鱼邮件有没有全部标记?草稿收件地址和会议日期对不对?JSON里的供应商、价格、数量和淘汰原因能不能全部对上?


而模型的得分,要这23组全部通过,才算答对,才能得到这1分,一旦有1个检验出来错误就0分,非常严格。


也就是说,没有过程分这个东西,你只有所有检测项全对才有分,因为模型去解决真实的电商问题的时候,这差一步,可能就会让你丢了单子,这才是真实的商业世界。


最后的得分就按通过的任务数除以总任务数量107。


于是,最终就是上文看到的排行榜,几乎没有及格的。


而如果用他们自己的Agent产品Accio的框架跑,通过率会整体高一些,模型通过率50%以上的,从2个增加到了6个,毕竟是专门做电商的框架。而因为是评测集,同时因为也是全自动化,平时大量的任务,其实是人和Agent协同,所以完成率也会实际更高一些。


说一个反常识的真相,Agent如今在真实工作场景的成功率依然很低。


而如果我们对比一下Coding任务上的跑分,大家就能看出来差距了,我们拿今年5月底发布的DeepSWE举例。


这个评测基准包含了113个任务,考的是AI能不能在真实的开源代码仓库里,独立完成一次复杂、跨文件的软件工程改动。


说一个反常识的真相,Agent如今在真实工作场景的成功率依然很低。


所有模型都用mini-swe-agent框架跑,模型自己去阅读代码仓库、查找问题、修改文件、运行测试,最后提交结果。


排在最前面的这几个模型,任务通过率都能到70%以上。


说一个反常识的真相,Agent如今在真实工作场景的成功率依然很低。


类似的低分情况,也出现在了其他领域的真实任务评测集里。


比如上个月底,腾讯混元联合清华大学和东南大学发布的这个E-Bench。


说一个反常识的真相,Agent如今在真实工作场景的成功率依然很低。


它模拟了3个产品场景,分别是王者荣耀、QQ音乐和腾讯会议。


一共设置了323个需要模型真实去操作的任务。比如王者荣耀要整理好友、战队、房间和比赛记录,QQ音乐要搜索歌曲、管理收藏歌单,腾讯会议要筛选参会人员、预定会议等。


E-Bench一共测了11个模型。


说一个反常识的真相,Agent如今在真实工作场景的成功率依然很低。


成绩最好的是Kimi-K3,Avg@3是73.79%。这里简单解释一下Avg@3这个指标,它指的是模型在任务集上独立运行3次,3次得分的平均值。


但现实中,我们肯定希望模型不只是做对一次,而是能反复多次完成任务。


所以他们还测试了同一道题独立运行3次的情况。


表现最好的K33次全部做对只有58.82%。


而11个模型在这个稳定性指标上都没过60%。。。


还有比如小红书今年先后也发布了两套模型在真实任务上的评测。


说一个反常识的真相,Agent如今在真实工作场景的成功率依然很低。


比如这个偏生活的VibeLifeBench。


这个评测包含200个持续时间数周的生活任务,覆盖了职业、健身、租房、购物和差旅等10个领域。


同样还是给大家看看各个模型在榜单上的得分。


说一个反常识的真相,Agent如今在真实工作场景的成功率依然很低。


榜单上成绩最好的是Claude Opus 5,它的avg@3也依然只有32.5%。


就真的更有点惨不忍睹了。。。


这3套评测基准的任务、指标等等都不一样,所以不能横向比较,但至少能说明,在它们覆盖领域的真实世界任务上,大模型的表现,确实还有极大进步的空间。


所以这个时候,纯靠模型公司我觉得也不行了,需要所有产商一起努力,就像Accio也说,会持续提炼真实的工作任务,然后把这些评测集数据滚动更新然后开放。毕竟这些厂子最重要的目标,是做Agent,是做模型路由,只有模型牛逼了,他们才能实现给自己客户的价值最大化。


不过比较可惜的是,就是这些评测集更偏向于研究,更新的不够及时,一些新模型出来可能要很久以后才会更新,所以还没有办法放到AIHOT的排行榜里面。


不过我未来可能会把类似于阿里国际站的RealReplicaBench、腾讯的E-Bench、小红书的VibeLifeBench等等的真实世界工作的评测集全都收集起来,然后我自己搭环境,我自己花钱来跑,一发新模型就全部跑一遍,保持更新,再把这些评分放到AIHOT上,方便大家查看,大家可以期待一下~


大家如果有类似真实世界工作任务的评测集,也欢迎评论区留言跟我提供。


最后,我想说。


在AI的世界里,会解题,和会工作,中间确实还隔着一些比较遥远的距离。


模型在Coding这个任务上,现在确实做的很好,跑的很快,但是在大量真实工作任务的场景中,还有很大的进步空间。


毕竟,那些琐碎、混乱、没有标准答案的东西,才组成了我们每天真正面对的工作。


因为,这才是真正的。


人类世界。


文章来自于"数字生命卡兹克",作者 "卡兹克、tashi"。

AI转型,免费服务,就找AITNT
AITNT资源拓展
根据文章内容,系统为您匹配了更有价值的资源信息。内容由AI生成,仅供参考
1
AI工作流

【开源免费】字节工作流产品扣子两大核心业务:Coze Studio(扣子开发平台)和 Coze Loop(扣子罗盘)全面开源,而且采用的是 Apache 2.0 许可证,支持商用!

项目地址:https://github.com/coze-dev/coze-studio


【开源免费】n8n是一个可以自定义工作流的AI项目,它提供了200个工作节点来帮助用户实现工作流的编排。

项目地址:https://github.com/n8n-io/n8n

在线使用:https://n8n.io/(付费


【开源免费】DB-GPT是一个AI原生数据应用开发框架,它提供开发多模型管理(SMMF)、Text2SQL效果优化、RAG框架以及优化、Multi-Agents框架协作、AWEL(智能体工作流编排)等多种技术能力,让围绕数据库构建大模型应用更简单、更方便。

项目地址:https://github.com/eosphoros-ai/DB-GPT?tab=readme-ov-file



【开源免费】VectorVein是一个不需要任何编程基础,任何人都能用的AI工作流编辑工具。你可以将复杂的工作分解成多个步骤,并通过VectorVein固定并让AI依次完成。VectorVein是字节coze的平替产品。

项目地址:https://github.com/AndersonBY/vector-vein?tab=readme-ov-file

在线使用:https://vectorvein.ai/付费

2
智能体

【开源免费】AutoGPT是一个允许用户创建和运行智能体的(AI Agents)项目。用户创建的智能体能够自动执行各种任务,从而让AI有步骤的去解决实际问题。

项目地址:https://github.com/Significant-Gravitas/AutoGPT


【开源免费】MetaGPT是一个“软件开发公司”的智能体项目,只需要输入一句话的老板需求,MetaGPT即可输出用户故事 / 竞品分析 / 需求 / 数据结构 / APIs / 文件等软件开发的相关内容。MetaGPT内置了各种AI角色,包括产品经理 / 架构师 / 项目经理 / 工程师,MetaGPT提供了一个精心调配的软件公司研发全过程的SOP。

项目地址:https://github.com/geekan/MetaGPT/blob/main/docs/README_CN.md