刚读了一篇 AI4AI 论文《AI4AI at Scale》,来自 XYZ Agentic Team。还是第一次听到这个 Lab。
他们用 AI4AI 的方式做出了两个很强的搜索 agent,也公开了方法。借这篇 paper 讲讲 AI4AI 到底怎么工作,下面尽量少堆术语。

他们的视频播客里披露:十几名员工,配上约 400 个 Agent Workers,两个月做完了这套 Deep Search 系统(这 400 是整个项目里参与分析、开发、实验和评审的执行单元,具体任务再临时组队)。

① 先把它想成一个准备考试的学生
就像学生可以改学习资料、换解题方法、调整计算器,分析自己上次为什么答错。但永远不知道标准答案、也不知道阅卷规则。最后,新方法到底有没有用,由一位独立考官测试,考过保留,没过就退回。
论文把这套考场规则叫optimization contract。人类先写清楚要提升什么能力、允许 agent 改哪些部分、每轮能用多少资源、什么情况必须停。AI optimizer负责找问题和试新方案,isolated evaluator像独立考官,只给分数和必要的错题反馈,不泄露答案;gate决定这次修改是保留、拒绝,还是交给人判断。
每轮实验都会写进shared experience memory。成功方法留下,失败方法也留下,并注明当时用了什么数据、工具和评测版本。这个 memory 由 agent 自己维护,作用很像学生时代的错题本。
我也看了他们在youtube的访谈,访谈把 memory 讲得比论文更具体。
它实际上分两层:第一层:保存所有原始日志,用于审计、复现,以及从任意 checkpoint 重启;第二层:把日志整理成结构化经验,比如当时看到了什么、证据链是什么、人类有没有介入、方案为什么通过或被拒绝。
更有意思的是,经验也有保质期。搜索工具和网页一变,过去有效的方法可能就失效了,系统会自动重新 review,把过期经验标出来。
所以严格来说,它不只是错题本,更像一本会自动修订旧答案的实验室 Wiki。

整套流程叫 AI4AI,核心是一个四步循环:Research → Development → Review → Record。

他们管这套东西叫bounded-exploration AI4AI。核心逻辑:人定义好目标、预算和边界,AI 在这个框里自己诊断、自己改、自己测试,但最终能不能合并进主分支,那张门禁卡还是捏在人手里。
② 这个框架真正拿来做 Deep Search agent 时,主要做了三件事
第一,搭一条自动命题流水线。
普通 QA 搜一个关键词就能找到答案,训不出真正的搜索能力。但人工出难题太慢,一天写几百道就到头了,喂不饱训练。
所以团队干脆把出题这件事本身也自动化了:先把抓来的网页连成一张证据图,网页是节点,超链接和引用是边;再从图里随机捞一个连通子图,把散落在几个页面上的证据拼成一道题;最后自动把题面里直接出现的人名、日期、机构换成间接线索,比如不说“2021 年”,说“在那家公司搬到新总部的第二年”。
整条线不需要人坐在那里出题,所以能一直往下跑,源源不断产出必须多跳查找、还得自己做消歧的搜索任务。模型靠背关键词是过不了的。
第二,只让模型学习“它当时真的看见了什么”。
长任务里,后台完整档案可能保存了所有搜索结果,但 agent 当时脑子里的东西早被压缩或折叠过,早期搜到的网页,可能只剩一句摘要。
如果训练时把完整档案都喂给它,就像学生考试时只看到半页材料,复盘时却拿着整本答案在学。学的时候什么都齐全,真上考场又只有半页,自然对不上。
所以训练数据必须严格对齐它做任务时实际能看到的版本,包括摘要过的、折叠过的那部分历史。
第三,工具和复盘系统一起改。
agent 始终只有三个工具:search固定返回 top-10,scrape负责取网页内容,python在单个任务里保留变量和文件。系统同时保存完整档案和 agent 每一步实际看到的版本。
这样答错的时候,能分清到底是没搜到、网页没抽对、旧证据被挤掉了,还是证据明明在眼前却没用上。
结果:

③ 全文我觉得最有意思一件事:AI 自己提出了人类没想到的改法
团队原本觉得,让 agent 自己决定什么时候整理 context,会增加它的负担,所以这个方案根本不在人类最初的尝试清单里。
结果 AI 分析历史日志后,主动提出了active compact:由 search agent 自己判断什么时候该整理上下文、保留哪些证据,并且把方案实现了。人类只负责验收效果,以及检查有没有 ground truth 泄漏。
这个例子非常重要。它第一次具体回答了:AI4AI已经超出“替人跑实验”了:从失败记录里看出问题,提出人没想到的方向,然后自己动手做出来。
④ AI4AI 和 AutoML 到底差在哪
这个问题他们博客里专门写了。
AutoML 通常是在预先划定的空间里,优化模型架构、训练方式和参数。AI4AI 改的是包含模型在内的整套系统:数据怎么造、工具怎么调用、harness 怎么运行、评测怎么做、infra 怎么优化,都在范围内。
而且 AutoML 更像按数值规则不断试参数,AI4AI 会读历史实验、总结失败原因、参考人的意见,再决定下一轮改哪里。
这两年AI4AI一直是海外前沿实验室探索的重点。
2025 年OpenAI用 PaperBench 测 agent 能否从零复现 20 篇 ICML 论文,8316 个任务,最好成绩 21.0%,低于 ML PhD 基线。到 GPT-5.6,模型已经参与完整研发循环:诊断故障、改训练、跑实验、解释结果,再去改另一个模型。半年里 coding inference 研究算力涨了100 倍,agentic token 涨了约22 倍。
Anthropic那边,部署了 9 个 Claude Opus 4.6 实例做 Automated Alignment Researchers。在一个很窄的 weak-to-strong supervision 任务上,PGR 做到0.97;但迁移到 production-scale 的 Claude Sonnet 4 之后,没有统计显著提升。
所以AI4AI 确实已经走进研发流程了。也很高兴看到国内也有同样前沿的成果。
论文:https://xyz-lab.ai/blogs/ai4ai-at-scale/assets/bounded-exploration-ai4ai-system-optimization.pdf
团队访谈:https://www.youtube.com/watch?v=aC7BhGGQUPo&t=792s
文章来自于微信公众号 “AI Dancer”,作者 “AI Dancer”
【开源免费】AutoGPT是一个允许用户创建和运行智能体的(AI Agents)项目。用户创建的智能体能够自动执行各种任务,从而让AI有步骤的去解决实际问题。
项目地址:https://github.com/Significant-Gravitas/AutoGPT
【开源免费】MetaGPT是一个“软件开发公司”的智能体项目,只需要输入一句话的老板需求,MetaGPT即可输出用户故事 / 竞品分析 / 需求 / 数据结构 / APIs / 文件等软件开发的相关内容。MetaGPT内置了各种AI角色,包括产品经理 / 架构师 / 项目经理 / 工程师,MetaGPT提供了一个精心调配的软件公司研发全过程的SOP。
项目地址:https://github.com/geekan/MetaGPT/blob/main/docs/README_CN.md
【开源免费】LangGPT 是一个通过结构化和模板化的方法,编写高质量的AI提示词的开源项目。它可以让任何非专业的用户轻松创建高水平的提示词,进而高质量的帮助用户通过AI解决问题。
项目地址:https://github.com/langgptai/LangGPT/blob/main/README_zh.md
在线使用:https://kimi.moonshot.cn/kimiplus/conpg00t7lagbbsfqkq0