智源AREX自主研究智能体:从「盲目搜索」到「验证驱动」

AITNT-国内领先的一站式人工智能新闻资讯网站
# 热门搜索 #
智源AREX自主研究智能体:从「盲目搜索」到「验证驱动」
5179点击    2026-08-10 14:42

当大模型逐渐掌握对话、推理、编程和工具调用之后,自主研究被视为人工智能领域的「The Next Big Thing」。


自主研究意义在于,AI的发展将不再受制于人类知识边界,形成一种面向智能生产的全新Scaling Law——「投入多少能源,就将转化多少智力」。自主研究正是衡量智能体自主研究能力重要维度之一。


普通问答只需要定位一个事实,而自主研究面对的是一组相互关联、彼此制约的条件。智能体不仅要从庞大的信息空间中定位候选答案,还需整合分散甚至冲突的证据,并确认最终答案满足全部关键约束——只要有一项未验证,答案即为无效解。自主研究的核心难题并不是「搜索得还不够久或者证据难找」,而是:


智能体能不能知道当前答案到底已经成立了什么、还缺什么,以及下一步最应该研究什么,是如何让智能体在复杂约束中持续接近正确答案。


智源研究院发布的AREX正是围绕这一核心问题提出的。它抓住了自主研究中的关键突破口——「发现—验证不对称性」:完整答案往往难以一次性生成,但一旦形成候选解,便可以通过针对关键约束的逐项验证,快速定位不足并指导后续探索。


验证的意义并非仅仅判断答案是否正确,更重要的是帮助智能体理解「已经知道什么、还缺少什么,以及下一步应该研究什么」,从而让每一轮研究都更加精准、更具方向性。


这一思想的前瞻性在Jeff Dean近日创立的Discovery Loop公司得到印证:未来的人工智能不仅需要更强的推理能力,更需要通过持续的实验、反馈和修正形成自主发现能力。


AREX对「求解—验证」双循环的探索,体现了智源研究团队在自主研究方向上的前瞻性,也反映出通过闭环迭代推动智能持续进化,正在成为人工智能发展的重要趋势。


项目主页:

https://vectorspacelab.github.io/arex-model/

模型权重:

https://huggingface.co/collections/BAAI/arex

体验链接:

https://arex-research.com


AREX旨在训练能长期运行、

自我验证、持续修正的研究型智能体


AREX的目标,不是让模型在单轮回答中写出一个「看起来更完整」的答案,而是训练一种能长期运行、持续验证、递归修正的自主研究智能体——不是一次性给出答案,而是在「研究→验证→再研究」的循环中不断接近完整解,让模型真正具备持续改进当前解的能力。


面对复杂任务,智能体可以先给出一个阶段性答案;随后,它会逐项检查约束是否满足,保留已经验证的证据,定位尚未解决的主张,再发起更有针对性的后续研究。当新的证据到来后,智能体会再次更新答案、重新验证,并判断是继续深入,还是结束研究并输出最终结论。


这一过程可以递归执行多轮:研究→暂定答案→逐项验证→定位缺口→定向研究→更新答案。这里的「自我改进」,并不是指模型在执行任务时在线更新参数,而是指智能体对自身研究状态和当前答案进行持续修正。


它不再只是一个「搜索后回答」的工具,而更像一个会反复检查研究进度、修正研究路径、沉淀有效证据的研究助手。AREX通过双循环框架打通「找到答案」与「改进答案」的闭环AREX的整体方法,可以概括为一套双循环递归求解框架。内层循环负责「研究」,外层循环负责「改进」。


二者协同,让智能体不只是向前搜索,而是在每一轮中继承已有进展、修正错误方向,并不断接近更可靠的答案。


智源AREX自主研究智能体:从「盲目搜索」到「验证驱动」


内层循环Research Loop:内层循环负责完成一轮相对完整的研究。在这一阶段,智能体会围绕当前研究问题搜索信息、调用工具、收集证据、比较候选,并构造一个暂定答案。它的目标不是一次性得到终局解,而是形成一个结构完整、证据可追踪、后续可以被审计的当前解。


如果这是第一轮研究,智能体面对的是用户提出的原始问题。如果已经经过外层验证,那么它面对的就是一个被重新定义过、更聚焦的新问题。例如:补齐某项缺失证据,消解两个来源之间的矛盾,或者替换一个无法满足全部条件的候选答案。这意味着,每一轮研究都不是简单重复,而是在更清晰的问题上继续推进。


外层循环Self-Improvement Loop:外层循环负责判断当前答案究竟走到了哪一步。AREX会依据任务中的各项约束,对暂定答案进行逐项审计,并形成约束级别的置信判断:哪些条件已经获得充分支持,哪些仍然不确定,哪些关键主张缺少证据,哪些结论需要重新研究。


如果所有必要条件都得到足够支持,智能体就结束研究并输出答案。如果仍有条件没有解决,验证结果就会被转化为下一轮内层循环的研究目标。因此,外层循环不是简单地说「答案还不够好,再试一次」,而是明确告诉内层循环:已经解决了什么,接下来只需要解决什么。这让每一轮递归都能继承已有成果,而不是从头开始。


机制分析:

长程研究状态维护带来的性能提升


AREX的推理机制包含两个循环:内层研究循环负责搜索、访问网页、验证证据、更新上下文并生成暂定答案;外层自我改进循环根据答案、证据和置信度,决定接受、继续细化或重新开始。


其中,自主上下文更新(ACU)是关键。它不是普通摘要,而是面向下一步行动的研究状态:保留已验证发现、已排除候选、未解决约束和下一步计划。BrowseComp上的分析显示,AREX通常会主动更新上下文,而不是等到128K上下文窗口被塞满后才被动压缩。


受控实验显示,AREX完整系统在BrowseComp上达到82.5,比关闭ACU和外层循环的版本高出22.9个百分点。训练消融也表明,渐进式多轮能力训练、关键步骤聚焦监督和步骤感知强化学习分别贡献于工具交互、关键决策和长程策略优化。


智源AREX自主研究智能体:从「盲目搜索」到「验证驱动」


智源AREX自主研究智能体:从「盲目搜索」到「验证驱动」


训练消融进一步说明,AREX的提升来自多个环节共同作用。渐进式多轮能力训练先建立稳定的工具交互能力,关键步骤聚焦监督把训练信号集中到证据发现、路径否定与重定向、关键上下文更新等转折点,步骤感知强化学习则继续优化长程决策策略。


这也解释了AREX的核心思想:长程研究中真正难的不是例行搜索和访问网页,而是在关键时刻做对决定,什么时候相信一个证据,什么时候放弃一个候选,什么时候重整上下文并改变搜索方向,这些才是决定研究成败的步骤。


AREX让自主研究智能体

在长程任务中持续自我进化


长程研究不「失忆」:将「历史包袱」转化为「进度路标」。长程研究中的核心挑战,并不只是信息检索是否充分,更在于模型能否在持续延展的研究过程中稳定记住当前进展。随着交互轨迹不断变长,历史记录中会同时包含已验证的证据、被推翻的假设、中途放弃的计划以及大量重复信息。全盘保留这些内容容易让模型迷失方向,而简单截断又可能丢掉关键线索。


AREX的做法,是让模型在研究过程中主动调用上下文更新工具,将不断增长的交互历史整理成一个可以继续推进的研究状态。这种更新并不是普通摘要,而是一份「研究进度表」,帮助模型明确:当前研究到哪了?什么已经成立?什么已经被排除?接下来最该查什么?通过这种方式,模型能够持续继承有效信息、压缩冗余内容,并在当前阶段形成更稳健的最优解。


构造可验证的训练数据:从确定答案出发,生成可验证的研究轨迹。自我改进不是靠延长搜索轨迹就能堆砌出来的。AREX需要的是那种能真正教会模型如何发现线索、交叉验证、推翻错误候选、调整方向并继续前进的数据。


为此,AREX设计了一套可验证的自主研究任务生成方法:先从一个确定的实体答案出发,围绕它构造一组必须被真实证据支撑的约束条件,然后再把这些约束改写为无法通过关键词直接命中的开放式问题。这样生成的任务,迫使模型必须真正去搜索、比对和验证,而不是在文本表述里「找答案」。


随后,强教师模型在同样工具环境中完整执行这些任务,留下全过程的研究轨迹。但凡出现直接猜答案、忽略观察、证据不足或结论与证据矛盾等情况,整条轨迹都会被剔除。最终保留下来的,是从不确定候选逐步走向可验证答案的研究轨迹。


分阶段训练与关键步骤强化:使模型掌握自我改进的连贯策略。在获得高质量训练数据之后,训练顺序同样关键。AREX没有将所有轨迹简单混合训练,而是采取了分阶段策略。模型首先学习多轮工具调用和证据获取的基本能力,再逐步进阶到长链推理、候选比较和困难问题求解。同时,AREX还会巩固论文研究、高难知识推理等专项能力,避免不同任务之间的能力相互干扰。


AREX也不会把长轨迹中的每一步都同等对待。真正决定研究是否能够取得突破的,往往是少数关键转折点,例如找到关键证据、否定错误候选、切换搜索方向,以及更新研究状态。这些关键步骤会在训练中被重点关注,并在强化学习阶段继续优化模型的研究策略。


因此,AREX的自我改进能力并不是「多搜几轮」自然涌现的结果,而是由可验证任务设计、高质量轨迹筛选、分阶段训练和关键步骤强化共同塑造出来的。它的目标是让智能体更接近真正的研究者:能够判断何时坚持当前方向,何时及时掉头,何时停下来确认答案。


实验评估:

AREX以10B激活参数达到自主研究前沿水平


为了验证AREX是否具备真实自主研究能力,智源研究院在六个基准上进行了评测,包括:BrowseComp、DeepSearchQA、WideSearch-en、GAIA、xbench-2510 和HLE with tools。它们分别覆盖信息深度、信息广度、深度与广度结合,以及端到端 Agent能力。


智源AREX自主研究智能体:从「盲目搜索」到「验证驱动」


信息深度:在多跳信息中持续挖掘


BrowseComp和xbench-2510的任务设计颇为苛刻:问题往往嵌入了多个相互约束的条件,正确答案隐藏在分散的网页与间接证据之中,模型需要沿着线索逐级深入挖掘。AREX-Base在BrowseComp上达到82.5,接近GPT-5.4、Kimi-K2.6、DeepSeek-V4-Pro和Claude Opus-4.6,同时超过GLM-5与Qwen3.5-397B。


在xbench-2510 上,它接近MiroThinker-H1,并优于Qwen3.5-397B与DeepSeek-V4-Flash。结果表明,AREX能力提升并非来自更多轮次的搜索堆砌,而是源于更稳定的研究状态维护——模型能够保留已验证信息、排除错误候选,并持续围绕尚未解决的约束推进。


信息广度:在大规模信息空间中全面覆盖


WideSearch-en考察的是另一项能力:在大规模搜索空间中尽可能完整地找到目标条目,并完成去重、核验与汇总。AREX-Base在该基准上取得了82.0 Item-F1,为论文对比范围内的最高结果,超越了Kimi-K2.6、DeepSeek-V4-Pro、GPT-5.4等模型。结果表明,AREX不只擅长「挖深一个答案」,也能管理大范围搜索任务,在长程检索中持续维护已覆盖范围和剩余空白。


深度与广度的结合:可迁移的研究方法论


DeepSearchQA同时要求多步检索、证据推理与答案完整性,是深度与广度的综合测试。AREX-Base在这里取得了89.9 F1,超过GPT-5.4与DeepSeek-V4-Pro和Qwen3.5-397B,并接近Claude Opus-4.6、Kimi-K2.6和Gemini-3.1-Pro。这说明AREX学到的不是某个特定领域的搜索技巧,而是一套可迁移的研究方法论:检索、比较、验证、修正、聚合。


端到端能力:从搜索到完整研究流程


GAIA和HLE with tools进一步要求模型将搜索与规划、推理、工具调用结合起来。AREX-Base在三项测试上分别取得85.4、71.0和52.4。在GAIA上,它超过Kimi-K2.6、Gemini-3.1-Pro和Qwen3.5-397B;在HLE文本子集测评下,它超过GLM-5、DeepSeek-V4-Pro、Qwen3.5-397B和MiroThinker-H1。这说明AREX的能力可以从搜索任务迁移到完整智能体工作流:模型不仅能找到信息,还能规划行动、调用工具、验证中间结论,并组织最终答案。


总体性能对比:开源前沿、闭源旗舰与同量级模型


与开源前沿模型相比,AREX-Base在双方均报告的BrowseComp、GAIA、WideSearch-en和HLE文本子集上全部领先。与DeepSeek-V4-Pro相比,AREX-Base在DeepSearchQA、WideSearch-en和HLE文本子集上更高。


与Kimi-K2.6相比,AREX-Base在GAIA和WideSearch-en上领先,在BrowseComp上接近,但在xbench-2510和DeepSearchQA上仍有差距。测评结果显示AREX不是「所有单项都领先」,而是以10B激活参数,在深搜、广搜、端到端智能体和工具推理之间取得了均衡的综合竞争力。


与闭源旗舰模型相比,面对GPT-5.4、Claude Opus-4.6和Gemini-3.1-Pro等闭源旗舰,AREX-Base同样进入多个高难度基准的竞争区间。它在BrowseComp上与GPT-5.4几乎持平,在DeepSearchQA上超过GPT-5.4,在WideSearch-en上超过GPT-5.4、Claude Opus-4.6和Gemini-3.1-Pro。这表明AREX已经能够在关键自主研究任务上与闭源旗舰模型正面竞争,尤其在大范围信息覆盖任务中优势更明显。


与同量级基础模型与智能体模型相比,AREX-Base的总参数量为122B,每次推理仅激活10B参数。相比同总参数量的Qwen3.5-122B,AREX-Base在双方均报告的指标上全部提升;相比更大规模的Qwen3.5-397B,AREX-Base在六项完整可比基准上全部领先。与专门面向搜索和研究任务训练的智能体模型相比,AREX也体现出较高的参数效率。


AREX-Turbo只有4B参数,但在多项指标上超过Qwen3.5-35B、Quest-35B和Tongyi-DeepResearch-30B;AREX-Base则在DeepSearchQA和HLE文本子集上超过MiroThinker-H1,并在xbench-2510上与其接近。这说明自主研究能力并不只来自扩大参数规模,也来自对长程研究过程的专门训练。


AREX研究平台:

将自主研究能力封装为日常研究工具


AREX LLMs解决的是智能体如何开展长期、可靠的自主研究,而AREX Research Platform在此基础上,将这一能力封装为面向科研与产业用户的日常研究工具。


学术与产业界每天都会产生大量新增信息——论文、技术报告、会议talk、开源发布与行业分析。而当前的信息分发机制多以发布时间或热度作为排序维度,而非依据用户的具体研究关注点进行组织。高价值信息被碎片化地呈现,使用者往往需要在多个来源之间自行拼接背景,信息获取成本高、效率低。


AREX平台以模型驱动的内容获取与研究智能体为核心,针对三类不同的信息形态提供独立入口:资讯持续追踪指定领域内的每日动态,论文筛选高关注度的研究工作并支持深度理解,播客从长时段访谈中提取关键观点与行业趋势。三者均由AREX智能体驱动,既支持广域浏览,也支持针对细分方向的定制化配置。


智源AREX自主研究智能体:从「盲目搜索」到「验证驱动」

AREX首页(最终效果以上线版本为准)


定制化资讯服务:在信息组织方式上,AREX平台支持用户指定关注方向(如Coding Agent、芯片行业进展等),并据此生成持续运行的专属资讯智能体,按设定频率完成检索、筛选与汇总。


与传统「源订阅」相比,这一机制以「用户关注点」作为过滤维度,使信息流由「按热度排序」转向「按相关性组织」,从而降低无关信息干扰,提升信息获取的针对性。


智源AREX自主研究智能体:从「盲目搜索」到「验证驱动」

AREX资讯定制


自由的可扩展性:此外,AREX平台在信息发现与自主研究之间提供直接衔接。每条资讯、论文或播客旁均提供自主研究入口,可一键调用AREX智能体。


智能体已感知当前阅读内容与上下文,无需重复交代背景,即可针对具体问题(例如「该方向是否有后续讨论」、「所选benchmark是否权威」、「相关观点在其他访谈中是否出现过」)启动检索、对比、分析与综合,输出完整的知识脉络。


智源AREX自主研究智能体:从「盲目搜索」到「验证驱动」

聊一聊


平台承担内容发现,智能体承担理解与分析,二者在统一上下文下衔接。这一设计是AREX区别于单纯资讯工具的核心所在。


当前版本的AREX Research Platform覆盖科研工作流中的「信息获取」与「认知构建」两个阶段,即帮助用户发现相关信息并理解其研究背景。智源研究院后续将能力延伸至研究执行阶段,由提供参考信息进一步发展为支持方案产出。


重点方向是端到端自主科研,包含以下三个环节:方案设计——智能体在理解问题与现有方法后,自主提出创新方案、实验设计、对比策略;工程实现——智能体直接生成可运行的代码框架、训练配置、评估脚本,并接入计算资源执行;性能调优——智能体分析实验结果,识别瓶颈,自动迭代超参、调整结构,持续优化迭代。


最终实现:用户定义研究问题,由AREX自主完成探索、实验与优化,并交付可验证的研究结果。


AREX当前已开放BETA版测试,欢迎大家体验并反馈:arex-research.com


文章来自于"新智元",作者 "桃子"。

关键词: AI新闻 , AREX , 智源 , 人工智能
AI转型,免费服务,就找AITNT
AITNT资源拓展
根据文章内容,系统为您匹配了更有价值的资源信息。内容由AI生成,仅供参考
1
AI代理

【开源免费】Browser-use 是一个用户AI代理直接可以控制浏览器的工具。它能够让AI 自动执行浏览器中的各种任务,如比较价格、添加购物车、回复各种社交媒体等。

项目地址:https://github.com/browser-use/browser-use


2
AI工作流

【开源免费】字节工作流产品扣子两大核心业务:Coze Studio(扣子开发平台)和 Coze Loop(扣子罗盘)全面开源,而且采用的是 Apache 2.0 许可证,支持商用!

项目地址:https://github.com/coze-dev/coze-studio


【开源免费】n8n是一个可以自定义工作流的AI项目,它提供了200个工作节点来帮助用户实现工作流的编排。

项目地址:https://github.com/n8n-io/n8n

在线使用:https://n8n.io/(付费


【开源免费】DB-GPT是一个AI原生数据应用开发框架,它提供开发多模型管理(SMMF)、Text2SQL效果优化、RAG框架以及优化、Multi-Agents框架协作、AWEL(智能体工作流编排)等多种技术能力,让围绕数据库构建大模型应用更简单、更方便。

项目地址:https://github.com/eosphoros-ai/DB-GPT?tab=readme-ov-file



【开源免费】VectorVein是一个不需要任何编程基础,任何人都能用的AI工作流编辑工具。你可以将复杂的工作分解成多个步骤,并通过VectorVein固定并让AI依次完成。VectorVein是字节coze的平替产品。

项目地址:https://github.com/AndersonBY/vector-vein?tab=readme-ov-file

在线使用:https://vectorvein.ai/付费

3
AI数据分析

【开源免费】DeepBI是一款AI原生的数据分析平台。DeepBI充分利用大语言模型的能力来探索、查询、可视化和共享来自任何数据源的数据。用户可以使用DeepBI洞察数据并做出数据驱动的决策。

项目地址:https://github.com/DeepInsight-AI/DeepBI?tab=readme-ov-file

本地安装:https://www.deepbi.com/

【开源免费airda(Air Data Agent)是面向数据分析的AI智能体,能够理解数据开发和数据分析需求、根据用户需要让数据可视化。

项目地址:https://github.com/hitsz-ids/airda

4
智能体

【开源免费】AutoGPT是一个允许用户创建和运行智能体的(AI Agents)项目。用户创建的智能体能够自动执行各种任务,从而让AI有步骤的去解决实际问题。

项目地址:https://github.com/Significant-Gravitas/AutoGPT


【开源免费】MetaGPT是一个“软件开发公司”的智能体项目,只需要输入一句话的老板需求,MetaGPT即可输出用户故事 / 竞品分析 / 需求 / 数据结构 / APIs / 文件等软件开发的相关内容。MetaGPT内置了各种AI角色,包括产品经理 / 架构师 / 项目经理 / 工程师,MetaGPT提供了一个精心调配的软件公司研发全过程的SOP。

项目地址:https://github.com/geekan/MetaGPT/blob/main/docs/README_CN.md

5
RAG

【开源免费】graphrag是微软推出的RAG项目,与传统的通过 RAG 方法使用向量相似性作为搜索技术不同,GraphRAG是使用知识图谱在推理复杂信息时大幅提高问答性能。

项目地址:https://github.com/microsoft/graphrag

【开源免费】Dify是最早一批实现RAG,Agent,模型管理等一站式AI开发的工具平台,并且项目方一直持续维护。其中在任务编排方面相对领先对手,可以帮助研发实现像字节扣子那样的功能。

项目地址:https://github.com/langgenius/dify


【开源免费】RAGFlow是和Dify类似的开源项目,该项目在大文件解析方面做的更出色,拓展编排方面相对弱一些。

项目地址:https://github.com/infiniflow/ragflow/tree/main


【开源免费】phidata是一个可以实现将数据转化成向量存储,并通过AI实现RAG功能的项目

项目地址:https://github.com/phidatahq/phidata


【开源免费】TaskingAI 是一个提供RAG,Agent,大模型管理等AI项目开发的工具平台,比LangChain更强大的中间件AI平台工具。

项目地址:https://github.com/TaskingAI/TaskingAI