过去一年,Deep Research Agent 被视为大模型落地的下一个突破口,它们会检索、能用工具、可多步推理,在一个个榜单上高歌猛进。但把它们放到真实世界的专业场景里,表现是否也同样亮眼?
先从一个每天都在发生、却少有人细想的问题说起:每一笔跨境货物通关,都必须先回答一个看似不起眼、却牵动巨大利益的问题:这件商品的海关编码(HS Code,商品名称及编码协调制度)是什么?这串编码是支撑全球每年约 26 万亿美元贸易的商品「唯一数字身份证」,直接决定关税计算与合规成败。如果报错,轻则多缴税款,重则货物滞留、触发合规风险。
那么,如果让今天最强的一批 AI Agent 去做这件跨境电商关务专员每天都在做的工作:给一件商品报出正确的海关编码,结果会怎样?
答案可能出乎意料:表现最好的系统也只能做对约 49.4%,而一位从业十年的人类专家能达到 95%。 这道接近腰斩的差距背后,藏着当前 AI Agent 一块被长期忽视的能力盲区,面对人类专家编写的层级规则,先进的 Deep Search Agent 集体「失灵」了。
正是这项工作,让阿里巴巴 ATH-MaaS(Alibaba Token Hub Model-as-a-Service)应用算法团队摘得了 ACL 2026 最佳资源论文奖(Best Resource Paper Award)。他们构建的 HSCodeComp,是首个面向真实、专家级场景的深度检索 Agent 层级规则应用基准。


ACL 2026 Best Resource Paper Award 获奖证书以及现场颁奖。
在本届全球仅 4 篇的最佳资源论文中,HSCodeComp 有着独特的分量:
奖项的背后,是一个看似不起眼、却让最强 AI Agent 集体折戟的问题。那么,这到底是一项什么样的任务,能同时撑起 26 万亿美元的全球贸易、又让人类专家与顶尖 Agent 拉开近一倍的差距?下面,我们就从这项工作本身说起。
被忽视的层级规则应用
回到任务本身。前面提到,HS Code 是决定这 26 万亿美元贸易如何通关、如何计税的关键,但真正报出它的过程,远比想象中专业。在阿里巴巴跨境电商的海关商品编码场景中,这一专家级任务需要将商品沿着人类专家编写的规则树逐层向下推导、精确归类到唯一的国际通用编码上。团队将其定义为层级规则应用(Hierarchical Rule Application),并发现它恰恰是当前 Agent 评测的一块关键盲区。

Figure 1|HS Code 是全球跨境贸易的基石,反映了理解真实商品世界所需的复杂度与专业性。
在实际申报中,资深关务专家需要依据严密的层级关税规则,把一件商品精准映射到唯一的 10 位细分编码,逐级细化:
2 位|章(Chapter) → 4 位|品目(Heading) → 6 位|子目(Sub-heading) → 8/10 位|国别码(Country-specific)
这本质上是一条必须满足规则树上所有约束的合法路径:只有每一层判定都正确,最终 10 位编码才成立。以常见的「AirPods 硅胶保护套」为例,申报时就要逐层回答一连串专业问题:它的材质「硅胶」该归入塑料(第 39 章)还是橡胶(第 40 章)?它算「表面覆盖物」还是「携带盒」?是「配件」还是「零件」?任何一层判错,最终 10 位编码就全盘皆错。

Figure 2|AirPods 硅胶保护套分类样例。
它的本质:一个「检索 + 推理」的深度检索任务

如下图的菜刀案例所示,f 并非一步到位的分类,而是一个多步「检索 — 推理 — 回溯」循环:每往下推一层(锁定两位编码),都同时依赖逐位推理与调用工具读取规则 / 裁定(GRI 规则、CROSS 裁定、属性核对)。一旦某一层判错,后续每一位都建立在错误前提之上。一位错,全码错。

Figure 3|每一步向下钻取都同时依赖「逐位推理」与「工具调用读规则」。
Level 3:被忽视的第三层能力
那么,这类专家级 Deep Search 与已有的 Deep Search 任务有何本质差异?团队把 Agent 所需的知识复杂度划分为递进的三个层次:

Figure 4|三级知识复杂度:从「读懂网页」到「用好结构化知识」,再到「精确应用分层专家规则」,能力要求逐级递增;Level 3 仍是空白。
Level 3 之所以困难,源于分层规则天然带着三大挑战:
1. 层级深、一步错步步错: 上层一旦判错(如把硅胶误归入橡胶第 40 章),错误会沿路径级联放大为整体失败。
2. 语义边界模糊(如下图蓝框): 规则里充斥「除…… 以外」「其他」「主要用于」等自然语言限定,边界模糊且高度依赖上下文。
3. 逻辑高度耦合(如下图红框): 规则间充满例外条款与交叉引用,某个品目能否成立往往取决于另一条注释是否被触发,牵一发而动全身。

Figure 5|层次化关税规则示例。
而这三大挑战并非 HS Code 独有。分层规则应用是众多高价值专业垂类的共性挑战:从法律合规、税务审计到医疗编码,凡是依据人类专家编写的层级规则的任务,都会遇到同样的困境。一个典型例子是 WHO 的 ICD-10 疾病编码,它与 HS Code 拥有几乎完全相同的分层规则结构,而这些编码直接决定患者的保险覆盖。因此解决层次规则应用在真实世界应用中会产生巨大的价值。

Figure 6|共性挑战案例:WHO ICD-10 层次化疾病编码决定了各个国家患者医保报销情况。
要可靠评估 Level 3 能力,就必须获得高质量的编码标注。由于任务的专业性与复杂度,HSCodeComp 刻意回避了常见的众包标注与 LLM 自动生成,转而追求真正的专家标注。它有三大设计特征:
标注遵循「双人独立标注 — 高级仲裁 — 抽样复核」的六步专业工作流:前四步覆盖商品档案抽取与分层规则应用,后两步做严格的专家交叉验证,两位专家独立标注、编码一致才接受,分歧由资深专家仲裁,另有第四位资深专家对随机 10% 样本重标,最终分歧率仅 2%。

Figure 7|六步专家标注流程。

Figure 8|品类与章节分布:贴合真实贸易分布;最具挑战的样本恰恰集中在长尾类目(如 Novelty & Special Use 1.3%、Men's Clothing 2.2%)。
在评测指标上,HSCodeComp 使用 Exact Match Accuracy,报告 2/4/6/8/10 位准确率,其中 10 位准确率是对端到端层级推理最严格的衡量。
团队在 HSCodeComp 上评测了 28个最先进系统,涵盖 GPT-5.5、Claude-Opus-4.8、GLM-5.2、DeepSeek-V4-Pro、Qwen3.7-Max 等基础模型,Hermes-Agent、SmolAgents、AWorld、AgentOrchestra、OWL、WebSailor 等开源 Agent 框架,以及 Manus、Gemini Deep Research、Grok DeepSearch 等闭源商用系统。(在论文原有 23 个系统评测的基础上,团队进一步补充了 Hermes-Agent、最新 GLM-5.2、DeepSeek-V4-Pro、Qwen3.7-Max、GPT-5.5 等模型的评测,将规模扩展到 28 个。)
核心发现:一道接近腰斩的鸿沟

Figure 9|核心结果:最强 Agent(10 位~49.4%)远远落后于人类专家(95.0%)。
直接看 10 位编码的 Exact Match Accuracy,结论指向同一个方向:
为什么「多想几次」反而更糟?
一个常见直觉是「多算几次、多反思几次总会更好」。但在 HSCodeComp 上,两种标准的 Test-Time Scaling 策略均告失效:多数投票几乎不带来提升(Agent 无法区分「正确路径」与「自信的错误」,投票只是在同源错误里挑众数);自我反思也非常微弱(模型既会纠正错误,也会把正确样本改错,更像盲目重试)。

Figure 10|Test-Time Scaling 难以弥合差距:投票曲线趋于平台,自反思不升反降。
更有意思的是,团队发现了一种 推理漂移(Reasoning Drift) 现象:强迫模型「想得更多」(增大 reasoning effort)非但不涨反而下滑,GPT-5 的 10 位准确率随推理深度从 40.82% 一路跌到 35.44%。根本原因在于,当有价值信息位于领域知识与规则中时,缺乏准确工具反馈的「自由发挥」会让 Agent 幻觉出并不存在的约束。这启发我们:对于有价值信息位于规则与知识中的专业任务,应优先做检索利用,而非让模型自己「想」。
到底哪些知识真正有用?
既然靠「想」和「投票」都不行,那到底哪些信息真正驱动性能?答案清晰地指向三点,重要性排序为:规则 / 知识检索(+8.5pt,地基)> CROSS 历史裁定(+5~10pt,稳定可靠)> 视觉信息(+4pt 且仅限强 VLM,边际补充)。
其一,Agent Harness 是不可或缺的地基。 把裸模型包进能「检索并应用最新专家规则与知识」的 Agent 框架后,10 位准确率从 28.96% 抬升到 37.42%(6 个 GPT-5 骨干 Agent 系统的平均,+8.5pt)。关键并不在模型「记得多少」,而在于能否即时检索到最新的分层规则、并按优先级逐层套用。规则不是简单塞进上下文就行,只有让 Agent 主动检索、动态裁决,才能把知识真正转化为准确率。

Figure 11|Agent scaffold 抬升 +8.5pt:6 个 GPT-5 骨干 Agent 系统的平均 10 位准确率(37.42%)显著高于裸 GPT-5(28.96%)。
其二,CROSS 历史裁定库带来最稳定可靠的增益。 三个骨干模型接入后 10 位准确率无一例外大幅提升(GLM-5.2 +9.65、DeepSeek-V4-Pro +7.76、Qwen3.7-Max +5.38)。因为真实历史裁定天然是高质量的 few-shot 先例:当规则语义模糊、多个品目看似都成立时,Agent 可以直接检索相似判例、参照海关既往逻辑来消解歧义,相当于给模型配了一本「判例词典」。

Figure 12|CROSS 历史裁定库带来一致增益:三个骨干模型接入后 10 位准确率均显著提升。
其三,视觉信息有用,但只是边际补充。 图像能补齐文本缺失的物理细节(材质、表面工艺、形态等),但增益有限且高度依赖骨干的视觉能力:GPT-5 +4.11(42.72%→46.83%),而 Claude-4-Sonnet 仅 +0.95、GPT-4o 几乎纹丝不动(+0.28)。也就是说,只有足够强的 VLM 才能真正「看懂」并用上图里的信息,视觉是有益补充,却替代不了对规则的精确应用。

Figure 13|视觉信号仅带来边际增益:GPT-5 +4.11,Claude-4-Sonnet、GPT-4o 几乎无提升,越弱的骨干越用不上图像里的物理细节。
这再次印证 HSCodeComp 是一个「规则 / 知识中心」而非「检索算力中心」的任务:决定成败的不是算得多快、想得多深,而是能否检索到正确的专家规则与判例,并严格、逐层地把它们应用到位。
难度从何而来?集中在长尾品类
最后把视角拉回数据本身:HSCodeComp 的难度是天然的,还是被数据倾斜人为制造的?跨 32 个一级品类,团队统计了两条互补分布:CID(最难样本分布):所有基线都判错的「硬骨头」样本在各品类上的占比;APD(平均性能分布):各品类上所有基线的平均 10 位准确率。
两条分布共同揭示两点:其一,最难的样本高度集中在长尾类目。CID 显示,全军覆没的样本扎堆在 Novelty & Special Use(数据占比仅 1.3%)、Men's Clothing(2.2%)等长尾品类,它们描述非标、样本稀疏,恰好暴露了 Agent「把规则泛化到数据稀疏领域」的短板;其二,整体准确率普遍偏低。绝大多数品类的平均 10 位准确率不足 25%,即便是数据占比最高的 Jewelry & Accessories、Home & Garden、Tools 等主流品类也低于 18%。这说明难度是分层规则本身固有的,且与品类是否高频无关:越是长尾、越是非标描述,规则应用就越容易崩塌。

Figure 14|按一级品类的难度分布。左:最难样本分布(CID);右:平均性能分布(APD);两侧蓝色细条为该品类的数据占比。最难样本集中在 Novelty & Special Use、Men's Clothing 等长尾类目。
HSCodeComp 不止是一篇评测论文。基于基准上获得的洞见,团队进一步在跨境贸易数字关务真实垂类场景中,落地了面向 HS Code 智能分类的 Agent 系统,验证了「先评测、后落地」的完整闭环。
团队先用 HSCodeComp 量化了「当前最强 Agent 远低于人类专家」的现状,随后设计了以 Qwen 为基座的 Agent 框架:多模态输入解析 → 基于 Deep Search 的检索增强推理(历史标签、专家知识、海关裁定)→ 工具集成的逐级校验 → 带可审计证据链的结构化输出。通过在 6k 个专家标注数据上做 SFT + Agentic RL 优化,团队设计的 Agent 框架和模型 以约 65% 的准确率稳居 AI Agent 系统第一位,大幅领先最强通用 Agent(约 49.4%)。
但需清醒看到:即便如此,距离人类专家的 95% 仍有明显差距。这说明分层规则应用对当前 AI Agent 属于结构性挑战,下一步的关键在于强化错误回溯、规则优先级动态判定,以及把推理牢牢锚定在专家规则与动态知识之上的能力。
而正如前文所述,分层规则应用是众多高价值垂类的共性挑战:ICD-10 医疗编码、美国《联邦法规》(CFR)、法律合规与税务审计等等。HSCodeComp 揭示的能力边界与诊断方法具备天然的跨垂类可迁移性,同一套「先评测、后优化」的闭环,可以复用到这些同构任务之上。
HSCodeComp 出自阿里巴巴 ATH-MaaS(Alibaba Token Hub Model-as-a-Service)应用算法团队,是其 Marco-DeepResearch 系列工作的一部分。该团队长期投入 Deep Research Agent 方向,致力于推动智能体在真实、专业的高价值垂类场景(跨境电商、数字关务等)中的可靠落地。近期,团队在该方向持续产出系列成果,相关工作均已开源:
在深度检索 Agent 高歌猛进的当下,HSCodeComp 像一记冷静的提醒:当 Agent 学会了「用工具」,下一道更高的门槛,是学会「敬畏规则」。 HSCodeComp 的实验结果显示层级规则应用是一个无法靠单纯 Scaling 填平的结构性瓶颈。
它的价值不止于揭示问题,更在于给出了一套可复用的诊断方法与优化闭环:先用专家级基准照出能力边界,再通过检索并严格应用规则 / 判例来对症下药。面向未来,团队希望构建能够将推理牢牢锚定在专家规则与动态知识之上的 Agent:让模型不再依赖内部记忆去「猜」,而是像专家一样逐级检索、严格应用规则,并在出错时可靠回溯。
文章来自于"机器之心",作者 "机器之心"。
【开源免费】OWL是一个完全开源免费的通用智能体项目。它可以远程开Ubuntu容器、自动挂载数据、做规划、执行任务,堪称「云端超级打工人」而且做到了开源界GAIA性能天花板,达到了57.7%,超越Huggingface 提出的Open Deep Research 55.15%的表现。
项目地址:GitHub:https://github.com/camel-ai/owl
【开源免费】Browser-use 是一个用户AI代理直接可以控制浏览器的工具。它能够让AI 自动执行浏览器中的各种任务,如比较价格、添加购物车、回复各种社交媒体等。
项目地址:https://github.com/browser-use/browser-use
【开源免费】字节工作流产品扣子两大核心业务:Coze Studio(扣子开发平台)和 Coze Loop(扣子罗盘)全面开源,而且采用的是 Apache 2.0 许可证,支持商用!
项目地址:https://github.com/coze-dev/coze-studio
【开源免费】n8n是一个可以自定义工作流的AI项目,它提供了200个工作节点来帮助用户实现工作流的编排。
项目地址:https://github.com/n8n-io/n8n
在线使用:https://n8n.io/(付费)
【开源免费】DB-GPT是一个AI原生数据应用开发框架,它提供开发多模型管理(SMMF)、Text2SQL效果优化、RAG框架以及优化、Multi-Agents框架协作、AWEL(智能体工作流编排)等多种技术能力,让围绕数据库构建大模型应用更简单、更方便。
项目地址:https://github.com/eosphoros-ai/DB-GPT?tab=readme-ov-file
【开源免费】VectorVein是一个不需要任何编程基础,任何人都能用的AI工作流编辑工具。你可以将复杂的工作分解成多个步骤,并通过VectorVein固定并让AI依次完成。VectorVein是字节coze的平替产品。
项目地址:https://github.com/AndersonBY/vector-vein?tab=readme-ov-file
在线使用:https://vectorvein.ai/(付费)
【开源免费】AutoGPT是一个允许用户创建和运行智能体的(AI Agents)项目。用户创建的智能体能够自动执行各种任务,从而让AI有步骤的去解决实际问题。
项目地址:https://github.com/Significant-Gravitas/AutoGPT
【开源免费】MetaGPT是一个“软件开发公司”的智能体项目,只需要输入一句话的老板需求,MetaGPT即可输出用户故事 / 竞品分析 / 需求 / 数据结构 / APIs / 文件等软件开发的相关内容。MetaGPT内置了各种AI角色,包括产品经理 / 架构师 / 项目经理 / 工程师,MetaGPT提供了一个精心调配的软件公司研发全过程的SOP。
项目地址:https://github.com/geekan/MetaGPT/blob/main/docs/README_CN.md
【开源免费】FASTGPT是基于LLM的知识库开源项目,提供开箱即用的数据处理、模型调用等能力。整体功能和“Dify”“RAGFlow”项目类似。很多接入微信,飞书的AI项目都基于该项目二次开发。
项目地址:https://github.com/labring/FastGPT
【开源免费】graphrag是微软推出的RAG项目,与传统的通过 RAG 方法使用向量相似性作为搜索技术不同,GraphRAG是使用知识图谱在推理复杂信息时大幅提高问答性能。
项目地址:https://github.com/microsoft/graphrag
【开源免费】Dify是最早一批实现RAG,Agent,模型管理等一站式AI开发的工具平台,并且项目方一直持续维护。其中在任务编排方面相对领先对手,可以帮助研发实现像字节扣子那样的功能。
项目地址:https://github.com/langgenius/dify
【开源免费】RAGFlow是和Dify类似的开源项目,该项目在大文件解析方面做的更出色,拓展编排方面相对弱一些。
项目地址:https://github.com/infiniflow/ragflow/tree/main
【开源免费】phidata是一个可以实现将数据转化成向量存储,并通过AI实现RAG功能的项目
项目地址:https://github.com/phidatahq/phidata
【开源免费】TaskingAI 是一个提供RAG,Agent,大模型管理等AI项目开发的工具平台,比LangChain更强大的中间件AI平台工具。
项目地址:https://github.com/TaskingAI/TaskingAI
【免费】ffa.chat是一个完全免费的GPT-4o镜像站点,无需魔法付费,即可无限制使用GPT-4o等多个海外模型产品。
在线使用:https://ffa.chat/