RSI(递归自我改进)已经热了一段时间。从 OpenAI、Anthropic 到谷歌,头部实验室都在探索如何让 AI 参与下一代 AI 的研发,创业公司也开始围绕它做产品、搭环境、建评测。
但当越来越多事情都被称作 RSI,一些基本问题反而需要重新回答。RSI 究竟是什么?模型已经能执行不少研发任务,但它能自己找到值得改进的目标吗?评测分数提高了,怎么证明它是真的变强,不是学会了刷分?创业公司在这条赛道上,和模型厂商抢的是同一块蛋糕,还是在做不同的事?
9 月 19 日,AGI House 在上海举办「AGI Frontier · The Recursive Loop」主题活动,围绕这些问题展开连线和圆桌讨论。参与讨论的嘉宾包括 Google DeepMind 主任资深研究科学家姚顺宇、Recursive Superintelligence 联合创始人施天麟、NeoCognition 联合创始人谷雨、Evolvent AI 联合创始人孟繁青,以及上海交通大学助理教授、Theseus Labs 创始人周煊赫。活动由 AGI House 创始人 Rocky Yu、合伙人 Jason Liao,以及红杉中国董事总经理张馨苑主持。
一些核心观点是:
以下内容转载自 AGI House,经 Founder Park 编辑整理。
Rocky Yu:我们先定义一下什么是 RSI。
姚顺宇:如果只是让模型自己生成数据,再拿生成的数据去训练,那就是最基础的强化学习。就是模型拿自己的在线策略产出的合成数据训练自己而已,这能算 RSI 吗?
RSI 和 RL 本质其实不一样。有些事一旦做到了,那就是 RSI,不再是普通 RL。举个例子,如果模型能自己设计整套训练流程,这就已经超出 RL 的范畴了。传统 RL 里,整套训练方案是人定好的,模型只负责产出训练数据。
所以我也不会说两者完全割裂。某种程度上讲,模型用自己生成的数据训练自己,只是 RSI 非常初级的婴儿阶段,未来还会演化出更深层的形态。
Rocky Yu:我们 AGI House 内部也讨论过这个定义:智能并非单指模型,而是一套完整系统。向 RSI 过渡的中间态是自我改进闭环,需要外围框架配合权重更新共同完成。仅权重更新,并不等于 RSI 闭环。
姚顺宇:没错。真正终极形态的 RSI 绝对不只是模型单方面的问题,而是系统工程。模型要能管好自己和人类、和环境交互的接口,就要涉及外围调度层、上下文管理层;想要掌控底层优化逻辑,还得吃透硬件优化层,像 CUDA、Triton 这样。所以自我改进最终一定是整套系统共同运转。
谷雨:RSI 是一个很大的概念。如果一定要找共性,我觉得有几个元素:首先它需要 AI 自己去找到自己的提升目标;接下来它需要自己找到方案去不断接近这个目标;同时它的目标往往会对应一个长程的任务,这个长程任务往往需要迭代或者递归来完成。其实大家怎么看待长程就决定了大家怎么看待 RSI,我们觉得长程不止是埋头做推理很长时间,而是一个持续学习和推理交叉耦合的过程。
孟繁青:RSI 就是在我们给定一个 environment 和 verifier 的情况下,在里面持续迭代某些东西。这些东西可能是不一样的,但最终的目标都是在这个环境中拿到一个更高的 verifier 得分。目前大家做的工作可能分成三个层级:
第一层:AutoResearch,修改某些 artifacts,比如改训练代码以降低 loss,环境是 repo,可改的是一个文件。
第二层:改模型权重,训练另外一个模型,可用合成数据、改算法、自己写 infra 等各种训练手段。
第三层:绝对意义的 RSI,模型优化自己,系统内只有自己、环境、verifier。
周煊赫:我在两位的观点上做一些补充。现在模型训练的边际收益越来越不明显,我们更需要 AI 自己去探索。特别是大家其实缺数据:不缺简单的数据,甚至不缺人去标数据,缺的是真正高价值、高质量的 corner case 数据,这背后的 RSI 其实就是一种 post-training 的好的解决方案。
对于一个 AI 系统来说,最本质的层面应该是 AI 参数、架构设计;再往外第二层是 code、workflow;再往外是环境,各种各样的文件、工作区。递归地从内部改,改不了、或者这个变量不让我改,就往外面改,递归地去解决问题。
施天麟:RSI 其实是很多科研人员长久以来的理想。今年才逐步看到落地苗头,很大程度归功于代码智能体迎来能力拐点。RSI 要解决的核心问题:怎么让 AI 自动化训练下一代 AI。很关键一环,代码智能体要能把 AI 自己的想法落地实现,迭代优化自身架构、数据集、训练算法。正是代码智能体变得足够通用,RSI 才有落地基础。
Jason Liao:我从反面来追问。三位对于目前行业里关于 RSI 的阐述中,最不认可或不能理解的观点或定义是什么?
孟繁青:我最不理解「专门做 RSI model」这个说法;我认为 RSI 能力本身是被上游模型厂训练时内化的。
所谓 RSI model 形态上只是一个自动化训练任务的模型,强调「方法是 RSI」并不成立:在 RSI 过程中,Agent 的行为 pattern 可形式化为 in-context BFS / DFS,选路径与回溯从代码逻辑变为通过 LLM 的 In Context Learning 原生完成。
系统上限取决于模型 long context 能力(回溯的长程性与精准性)和选 path 能力(降 cost、提 efficiency),选 path 本质是 world model + value model(类似 PPO 加 world model),这种能力已内化在基模训练目标里。
周煊赫:针对繁青的观点,我举一个反例,真实部署时往往必须到场景里训模型。
孟繁青:我说的不是垂域定制,而是声称用某种训练算法训出的 RSI 模型在环境中迭代 reward 的斜率更高。
周煊赫:我们的观点似乎是异曲同工的。我最不信的是做 RSI 的预训练模型 / 从头训模型;但我相信的是落地千行百业的垂域 RSI。
谷雨:最不理解的是为什么你们国内基金给 RSI 创业公司投那么多钱(开个玩笑)。我觉得从定义层面上我不太理解的是在 RSI 这个词出现之后,之前很多大家不称为 RSI 的东西都成了 RSI,比如 AutoResearch,比如 loop engeering,甚至 MLE。这是一个很不好的现象,定义本身的目的应该是让话题更明确而不是更 confusing,这样会增加大家去了解一个领域的难度。
Rocky Yu:近几个月,Oriol、Jeff Dean 创立了 Discovery Loop,Jerry Tworek 创办 Core Automation,来自 OpenAI 的 Benjamin 也成立了 Mirandao,各家都在冲刺 RSI 赛道。但抛开融资喧嚣,站在业内视角,你看到了哪些真正落地的成果?
姚顺宇:近几个月确实冒出来一大批初创公司,但我更看重真正落地的成果。很多内部落地案例不方便对外公开,包括我们自己和其他企业的工作。能公开说的是 Gemini 3.8 Flash,它后训练的核心流程,是模型自己摸索出来的。这是个很好信号:RSI 已经不再只是遥不可及的空想目标,近两三个月已经开始落地变成现实。
Rocky Yu:我跟 Sergey(谷歌联合创始人)聊过这件事,他几乎全部把重心都压在 RSI 上,我感觉这已经是谷歌的核心战略。
姚顺宇:不止谷歌,几乎所有头部实验室都把它当成重要方向。
Rocky Yu:怎么证明系统能自我迭代?有没有真切感受到它发生的时刻?去年 12 月 Claude Code 能力快速跃升,我们看到了自改进闭环的苗头。其他 RSI 项目是否也会出现类似信号?
姚顺宇:可以从两个维度看。从业务效果来看:对 AI 公司来说,当你不断扩大数据、模型规模、服务客户体量,却不需要同步扩张团队人力,这会是一个非常明确的标志。
从技术层面说:现在还有短板。现在模型执行能力很强,哪怕需求说得很模糊,它也能落地干活。但短板在于,它很难自己定义合理的评估标准、找到正确的优化目标,这是目前缺失的一块。不过我不认为这是无解的底层难题,说不定很快就能解决。
现场提问:「模型担任研究员」是 RSI 非常关键的一环。如果模型真的能够独立开展科研,会不会存在一些无法绕开的本质瓶颈?还是说,只要收集足够多科研思维链数据,它就能自主设计实验、排查问题,完整跑通科研闭环?
姚顺宇:我并不认为存在什么根本性的硬障碍。在我看来,科研本质上更多是经验的沉淀,没有什么玄乎的魔法,就是合理地积累经验。如果说当下还有短板,那就是模型生成想法的多样性不足,但这不属于原则性难题,未来是可以解决的。
现场提问:头部实验室把 AI 研究员落地,很重要一点是沉淀海量实验经验——哪些方案有效,哪些会失败。这些经验后续会不会内化为模型科研能力的一部分?另外,AI 研究员可以在已知搜索空间内批量做对照消融实验、 挖掘新洞察,但完全未知的探索空间,模型要怎么去发现?
姚顺宇:第一,过往科研数据、完整实验轨迹价值极高。但难点不在于拿到数据,而是怎么从海量原始数据里提取真正高价值信息,这会是未来一大挑战。
第二,这点和前面话题相通。模型执行能力很强:只要搜索空间边界清晰、方便探索,从中找到更优方案并不难。真正难的是找到合理的搜索空间本身,这也对应现在模型想法多样性不足的现状。
现场提问:我们实验室主攻通专融合,聚焦科学自主发现。科学场景能不能带来代码场景给不了的能力增益?如果代码训练已经足够激发模型智能,科研场景还能补充什么?
施天麟:做科研离不开写代码、实现实验,但科研还有大量能力超出代码本身。类比博士生:自主学习能力、好奇心、文献调研、读论文复现实验、原创提出新想法,这些都有待模型进一步突破。
现场提问:模型既要输出答案,又要自己评判答案,怎么避免它自我麻痹,越觉得自己做得很好?尤其是没有标准答案的开放性任务。如果基准评测集本身也被 AI 持续修改迭代,那这套评测还能证明模型真的变强了吗?RSI 最难的到底是实现自我改进,还是证明自己确实改进成功?
姚顺宇:最难的恰恰是证明自己真的取得进步。实现自我迭代反而没那么难,验证迭代有效才是最大难点。 这也呼应了前面聊的内容。很早之前就有相关研究,当时还不叫自我改进,叫自我博弈:一个 AI 出题,另一个 AI 答题。最常见的坑就是奖励投机,直接掉进局部最优:要么出题方一直出简单题,答题方永远答对;要么一直出超难题目,永远答不对。
核心难点就在于,模型如何真正客观评估自身的进步。也正好回应之前的问题:到底是定义问题更难,还是解决问题更难?一定是定义问题更难。
现场提问:我们来聊聊 long-horizon task。目前这类任务大多依靠多智能体推进,那单智能体路线该如何在执行过程中获取有效反馈?长周期任务最大的痛点,就是反馈链条过长。
姚顺宇:这是当下非常火热的前沿研究方向,开源社区已经有不少相关尝试。大家会搭建基于过程的奖励模型,但最大的难题是很难规模化落地。
目前主要有两种思路:第一种是设定明确规则,比如写代码就统计测试用例的通过数量,把通过率作为过程奖励。但这很容易让模型陷入局部最优。第二种是直接用大模型自身充当过程奖励。可一旦扩大规模,就很容易出现奖励投机、钻规则漏洞的现象。所以这个问题至今依旧棘手。
想要实现突破,我们需要弄清楚,过程奖励放到完整上下文当中会产生哪些连锁效应,同时还要让模型具备自我分析的能力。这是潜在的突破口,不过目前还没有标准答案。
Jason Liao:verifier 作为 RSI 得以持续演进的卡点,三位能否分享关于 verification 的定义和思考?
谷雨:verifier 与目标、不断迭代相关。RSI 的定义前提是要有一个目标,并在这个目标上不断把自己做得越来越好。
这必然涉及一个「verify 自己做得怎么样」的过程——这就是 verification 存在的意义。现在 verifier / grader 很受关注,原因在于做 RL 时需要泛化到那些没有天然 verifier 的场景(不像数学、勾股定理那样有明确的验证过程)。
但这类 verifier 本质上验证的是什么?是完成一个 task 后的 task trace。比如让模型写一个游戏、做一道数学题,去看这中间的执行过程对不对。放到 RSI 视角下,目标就是解决这个 task,verifier 的目标也就是评估这个 task 做得如何。可以进一步泛化。我们 evaluate 的目标未必只是「把这个账单填好」,而是「如何变成一个更好的会计」。
这时会有一种更 meta-level 的理解:不只是评估这一个具体任务,而是审视模型在成为更好的会计之前,到底存在哪些能力缺陷。AI research 里有个经典词叫 meta-cognition,现阶段其实没有被足够重视。人类智能很大程度来自元认知:能够思考自己的思考、意识到自己缺什么,再基于对自己的反思去提升自己。
周煊赫:非常认同谷雨的观点。补充一点,reflection 很重要,而 reflection 的关键在于利用好环境里那些非常冗杂、非常多的信号量。用好环境里的这类 evidence,是核心。
孟繁青:谈谈我对 rubric 的看法。大家普遍觉得设计 rubric 很难:题目复杂、要完成的点很多,rubric 也随之复杂;而且很难检验 rubric 与题目是否 alignment——像谷老师他们做的各种专业领域 bench,我们其实也很难去检测。但我认为,这些复杂的 rubric 都是一个中间态。它的复杂性来源是当前的环境和题目。
像 coding 场景就几乎没有鲁棒性问题——环境简单朴素、目标一致,最后的衡量就是性能本身(加速比)。如果说 benchmark 最终应该去评测人做不到的领域;那当人都做不到时,bench 的目标就是这件事的经济价值。如果还是以人的视角做环境、rubric 和题,是不是都是中间态?
如果换成端到端视角——把 agent 放进环境里跑十天半个月,只看它最终产生的净价值——整个问题就没有 rubric 了,又会归结到怎么搞到这样一个环境。比如炒股,直接放进真实市场成本高、还难以回测,所以关键是怎么建一个不会被 hacking 的 mock 环境。总之,复杂 rubric 可能都是中间态;回到最本质的经济价值,问题又回到环境这一侧。
张馨苑:你们认为 verification 未来都应该由 AI 接管,还是 human-in-the-loop 必不可少?
周煊赫:短期内 AI 完全取代人不现实。当前设计需要跟着需求走,执行任务的 pass 判定很重要。上来就靠 AI 解题的事在做,但为稳定质量仍需人保障。
谷雨:AI 确实能做一部分,但很多事情上仍需要人。一是 AI 的准确率还很难保证; 二是很多场景下人比 AI 更便宜——比如 ApprenticeBench 最近做的 human evaluation,人比 AI 还便宜,那为什么不用人?
孟繁青:我的观点跟两位老师都类似,近阶段和中短期来看,还是要去找人类专家,以及工具去调用的。整体来说,长期来看,我还是刚才那样的观点:长期来看 verifier 会简单化,但环境会很复杂。
现场提问:不少国内模型厂商都提到,除代码、数学之外,金融、法律、医疗这类生产力场景,模型输出质量很难自动核验,仍然依赖人工筛选。你刚才提到评估并非底层死结,那在这类非标业务场景下,如何搭建闭环,让模型实现自我评测?
姚顺宇:我要是有完整答案,早就动手落地了。恰恰因为这件事很难,大家都还没摸透,所以至今没有成熟方案。过往方案也都是基于奖励模型,和刚才说的过程奖励模型困境一模一样:规模上来之后,模型很容易投机取巧。法律、医疗我本身并不深耕。
如果谈直观感受:最好先扎进这些垂直行业,搞懂现实世界里人类是怎么搭建奖励体系、怎么评判成果好坏的。代码领域能跑通,本质是做 AI 的人本身就是程序员,非常懂这个行业的评判标准。但实话实说,我并没有针对法律、金融的成熟解法,我本身不做这两块。
Jason Liao:谷雨和孟繁青正好在近期推出了两个受业界关注的 RSI benchmark,分别是 ApprenticeBench 和 RSI Bench data。请两位分别介绍一下核心思想和 next step。
谷雨:ApprenticeBench 背后的核心思想我觉得还是可以分两个层面来说。首先从生产或者应用层面来说,ApprenticeBench 追求的是 ecological validity,意思是说我们关心的是 ApprenticeBench 上的结果,多大程度上能反映到实际的生产过程中去。我们希望通过 ApprenticeBench 去反映我们今天离让 AI 真正的去到人类的工作岗位上去还差多远。
为了做到这点,我们尽可能保证我们 benchmark 的真实性,包括使用人类真实使用的软件环境,去模拟真实工作场景中的各种上下文,比如公司历史数据,mentor 的 feedback 等等,同时我们还请了行业专家做顾问来验证我们提出的任务。
从科学研究层面来说,ApprenticeBench 也有很 unique 的一点,这个其实也反映了我们背后对于智能的一种哲学思想。我个人很喜欢 Francois Chollet 的一句话:「智能不是关于会做什么,而是关于是怎么学会做什么」。ApprenticeBench 评估的其实就是后者,关于一个会计公司内部的特定知识本身并不重要,重要的是模型怎么样能够让自己快速学会这些知识。
孟繁青:我理解谷雨是要深入调研某一个场景,给出非常严谨的环境、问题、verifier 三件套。我们的 RSI benchmark 主要做的还是偏 AI for AI 的任务:去迭代权重或者关系,共同提高它在某些 benchmark 上的表现。从这个角度看,它人力成本不是很高,不需要深入调研很多行业去出题。
这听起来可能像 Posttrain bench,但我个人觉得目前的 Posttrain bench 不太好的一点是,它并不是很真实的生产状态。我们做的 RSIbench - data 目前是一个 preview 的版本。我们有一个观点:对于 AI for AI,一个合理的设计是要把 everything as a service。比方说 eval,并不是说要模型在本地把 harbor 给弄下来,然后搭环境再测试,而是本身就应该存在于另一台远程机器上,模型只需要提供一个请求。
除了 eval 以外,training、rollout 的方式类似。这样带来的好处,第一是物理隔离,避免一定的 reward hacking;第二,这种请求的方式非常有利于模型在做的时候自发地去异步执行,提高效率。还有一个是 agent 的 flops 会花在它最需要的地方。比方说在这个系统中,我们会开放像数据、harness、甚至一些算法的修改接口。
我们把 AI for AI 所需用到的所有 infra,像 training、rollout、eval 全部包裹成一些 service,只暴露 skill 给外部的 agent 去调用。总结一下,我们在做的并不是像传统 benchmark 那种出题的形式,我们更注重能不能建立一个对 AI for AI 这种 RSI 应用更友好的环境,模型在里面可以自发地、任意地做任何 RSI 任务。我们最近会把这个完整的工作放出来。
周煊赫:我听了繁青讲的也很有收获,infra 特别重要,无论是从评测来看,还是我们去训练做各种场景。我们年初与阿里、飞书合作的 Workspace bench 评测企业级 AI 生产能力。回过头来说我对 Evaluator 的理解,我觉得这个事情也是极其重要的,定好方向、拉好擂台,大家上来你来我往,这是非常重要的事。但首先,擂台其实要做好。我们也做过一些探索:
谷雨:我来冒犯一下煊赫老师,你年初的那个 benchmark 现在被刷爆了吗?
周煊赫:分数确实涨挺高,到 80,接近人类的水平。
张馨苑:正好提到 benchmark 很容易被刷爆的现象。关于 Intelligence 难以量化、 容易被 hack 等 evlauation 当下普遍存在的问题,三位嘉宾怎么看?
孟繁青:Hacking 我理解它既有先验又有后验。后验可能比较简单,直接去读模型的轨迹,用一个 agent 判断它有没有 hacking 现象;但这其实也不是很本质,因为它有可能 hacking 掉这个检测的 agent。先验的 hacking,我会感觉这件事从工程设计上非常难解决,因为只要联网,就一定会存在可能 hacking 的情况,只能 case by case 解决。
我觉得防 hacking 这个事落到最后,会是一个数据问题,相当于你的网络上找不到你这个测试数据。再谈对于现在非常多的 benchmark,verification 的设计非常困难,主要有两个因素:第一是可复现性。因为当环境越来越复杂以后,它再也不像数学题那样根本没有环境的概念。比方说我们这里的环境,甚至会涉及到硬件的型号、系统是 Windows 还是 Linux、内存,或者 CPU、GPU 的各种型号都会涉及,所以不同的物理平台上就会存在差异。
除此之外,现在大家都知道每一题都给你算分、归一成一个 0 到 1 的分数,其实此时这个评分分数并不具有很强的物理意义,绝对分数其实并没有太多意义。
所以我们团队一个同学提出了一套基于 ladder 的评估标准,不同的 layer 里会对应不同的参照答案(artifacts),在每个新平台上都会通过跑这个参考答案来确定我这个模型到底属于哪个 layer。这样一定程度上避免了刚说的不可复现所导致的一个情况。
谷雨:我还是想说两点。首先关于量化 intelligence 本身,这件事就是很困难,因为任何一个东西只要足够复杂,你就是很难去量化它,并且现在客观来说,找到合适的评估也是所有 seriously 训模型的人都很头疼的问题(欢迎各个模型厂来联系我们 ApprenticeBench)。
另外关于 Hack,这个很大程度上不是一个技术问题,而是经济和人性的结构性问题。大家都知道现在一旦公开一个 benchmark,就会有 data vendor 去造 in-distribution 的 training data 来卖,实质上这是在帮模型厂作弊的很破坏行业生态的行为。这里我不是针对某一家 vendor,而是说在座的所有 vendor。其实在这种环境下,一个 benchmark 能生存三五个月已经非常不容易了。我们这次没有公开 ApprenticeBench 的数据一定程度上也是基于这个考量。
周煊赫:应对刷榜有两个思路。思路一:设计任务时用真实规则的社交类任务(如狼人杀但另一套规则),作弊手段失效。思路二:持续更新 bench。
另外一块,我从综合的角度可以跟大家分享一个不太一样的观点:大家往往会觉得环境的信号稀疏,一定程度上并不是特别对。所谓稀疏,是说你对结果和过程的反馈是缺乏、匮乏的,其实不是这样。比如我们处理一些邮件,比如这些生活邮件,其实你是会有反馈的,只是它可能没有集中到一次。其实你的反馈信号不存在于你对这个交互的直接反馈上,而是在一个人正常使用过程中的一些信号上,这个信号非常多,能给我们带来最好的 AI 使用反馈。
张馨苑:最近我一直在思考的问题是,投资 RSI 究竟是投 Neo lab,还是本质是投资 application。如果是投 Neo lab,AI for AI 的 base model 和 infra 如何与 established 模型厂商竞争?
如果是从 RSI 应用的视角,无论是 2B FDE 的呈现形式还是 2C 追求的个性化数据飞轮,是否本质最核心的是一套 environment 和 verification co-design 的 self-improving harness?三位嘉宾也正在创业,你们如何思考 RSI startup 和模型厂商的边界?
什么是模型厂商有绝对优势的,什么地方 startup 能做出不一样的特点?
孟繁青:RSI 的概念很大,也有不同应用层级。但基本上都可以形式化成给定环境下去探索:对于模型厂商,goal 比较明确,就是提升模型智能,此时环境是各种 benchmark;对于下游应用,本质可能是"能不能提供更多的环境",这可能是一个做事的出发点。
周煊赫:大厂手再多也顾不上千行百业,必须给出一套落地范式,核心是「数据的环境」和「对真实环境的理解」。数据的环境,指怎么能知道这个场景下的环境里,哪些数据对增强 agent 是有帮助的,不同阶段的数据系统的搭建也是非常重要的事情。
另一方面是环境的角度,很多时候环境是非常杂乱的。我们曾经做过一个实验,把最好的模型放进一个杂乱的环境里找文件或者处理各种问题,能力会降得非常多。所以怎么样能很好地理解环境、跟模型一起去协同计划办事,也是非常重要的一个事情。
谷雨:我觉得创业公司有两个角度。第一个角度是直接去服务模型厂商;第二个角度是和模型厂商互补。服务最直接的例子就是卖数据给模型厂商,比如我们今天可能会考虑卖 ApprenticeBench 的 eval service。互补的话我觉得就是要避开和模型厂关注的核心问题上竞争。
我个人认为所有涉及可泛化的 intelligence 相关的东西都应该归模型厂,但是我们在做的事是怎么把 intelligence 变成 expertise。我们说一个人聪明往往不是说这个人什么都会,而是说这个人能很快学会一个新东西。所以打个比方,模型厂商生产的是聪明的人,而我们负责把聪明的人培养成合格的员工。
Jason Liao:最后,你们最期待 RSI 的什么范式突破?以及,未来什么潜在的范式突破,会对你们正在做的事情带来较大的颠覆和威胁?
孟繁青:我最期待 RSI 的范式突破,可能跟我个人的兴趣有关系,我还是比较关注一些底层 infra 的东西。从我的角度我会思考:现在的 infra 都是对人来设计的,之后是不是会有一些针对 agent 去设计的方式?
举个点,之前大家去集群提交任务,会涉及到任务排序,但原来因为是很多不同的人提交,任务排序可能跟这个任务的重要性不挂钩了;那现在对于一个由 agent 来运营的集群,它就会有类似于任务实际重要性的排序。这种原本是对于人类需要努力设计的东西,会不会出现一些更先进的方法。
谷雨:我个人还是会更押注新的持续学习范式。真实环境和现在模型的训练环境有巨大的差别,最主要还是体现在数据上。首先真实世界里没有现成的 well formated 的 input-output pairs 或者现成格式的 traces 来训练,同时真实环境也没办法像 sandbox 或者 simulator 那样 RL 做大量 rollout。
想象一下 agent 发错了一个邮件得罪了合作商,可能就再也没有下次机会了。这就是所谓的真实世界是 non-grindable 的。这些都意味着我们需要更 sample-efficient 的学习方式,比如现在基于外挂 memory notes 的方案。
但是 memory notes 也有自己的问题,首先修改 memory notes 目前并没有任何严格的优化算法,其次 memory notes 本身表达能力也有限,或者说 compression rate 不够高。另一方面,基于参数更新的方式有很强的 expressivity 和 compression rate,但是有我们刚说的 sample efficiency 的问题。
所以我们未来重点会关注两个方面,一个是有没有更先进的 LLM 非参数学习的方式,一个是如何把非参数知识进一步压进参数,形成闭环。目前前者主要基于 memory notes,后者很大程度上靠类似 OPSD 之类的思想,都还有很大空间。
另外可能的外部变量是 test-time training(TTT):前面我说过模型厂提供聪明人,而我们把聪明人变成培训成专业的员工。TTT 可能会让后者变得越来越 trivial,这可能冲击我们的定位;但目前 TTT 还停在 data 或 task distribution 级泛化,很难处理公司范围内的精细知识。
周煊赫:RSI 最终还是要落回模型上。现在的问题是模型不够强,需补齐五方面能力:
主动感知环境:知道权限与可用资源;流式、低成本、多模态输入;能改造环境、 利用环境信息。探索能力。
关键信息感知:拿到部分数据后能找到其余关键信息。
在线 / 持续学习:不能只有全量训练模式,训练开销远大于推理开销,需要轻量化、小样本持续学习。
安全性:模型对自身能力边界缺乏感知,会越界、为达目的不择手段;要放心把权限交给 AI,AI 必须对自身边界可感知、可控。
文章来自于"Founder Park",作者 "Founder Park"
【开源免费】Browser-use 是一个用户AI代理直接可以控制浏览器的工具。它能够让AI 自动执行浏览器中的各种任务,如比较价格、添加购物车、回复各种社交媒体等。
项目地址:https://github.com/browser-use/browser-use
【开源免费】AutoGPT是一个允许用户创建和运行智能体的(AI Agents)项目。用户创建的智能体能够自动执行各种任务,从而让AI有步骤的去解决实际问题。
项目地址:https://github.com/Significant-Gravitas/AutoGPT
【开源免费】MetaGPT是一个“软件开发公司”的智能体项目,只需要输入一句话的老板需求,MetaGPT即可输出用户故事 / 竞品分析 / 需求 / 数据结构 / APIs / 文件等软件开发的相关内容。MetaGPT内置了各种AI角色,包括产品经理 / 架构师 / 项目经理 / 工程师,MetaGPT提供了一个精心调配的软件公司研发全过程的SOP。
项目地址:https://github.com/geekan/MetaGPT/blob/main/docs/README_CN.md