全球竞逐RSI,这支华人团队已跑通规模化闭环

AITNT-国内领先的一站式人工智能新闻资讯网站
# 热门搜索 #
全球竞逐RSI,这支华人团队已跑通规模化闭环
7464点击    2026-10-09 12:49

10 月 6 日,OpenAI 公开了 AI 产出的 722 篇数学论文,包括准黎曼猜想的相关证明。前 Google 科学家、xAI 联合创始人 Christian Szegedy 表示,数学家穷尽一生攀登的险峰,机器可乘飞机直接抵达。但 Szegedy 认为,数学不是走向终结,而是探索方式的改变 —— 人们可以借助飞机,抵达更多未境之地,他自己对此兴奋不已。


这架飞机,能否继续飞向更广阔的科学与工程前沿 —— 从癌症机理、衰老干预,到尚无成熟路径的复杂工程难题?


全球 AI 实验室正将目光投向 RSI(递归自我改进):让 AI 不只完成任务,还能参与下一代 AI 的设计、训练与改进。这场系统性探索才刚刚开始,大多数探索尚处于早期。


而一支华人团队,已经把 RSI 带入了规模化运行。它打造的 Novix,将自我改进机制嵌入真实的前沿算法与工程任务,让 AI 在解决问题的过程中,持续吸收顶尖专家的判断与反馈,并将这些经验用于自身的下一轮改进。


全球竞逐RSI,这支华人团队已跑通规模化闭环


官网链接:Novix.science


成立仅半年,Novix 通过口碑传播,已服务 20 万名专家,覆盖 40 多个国家和地区、500 多所高校及科研机构。用户中包括来自清华大学、北京大学、苏黎世联邦理工学院、剑桥大学、卡内基梅隆大学、南洋理工大学、新加坡国立大学和东京大学等机构的研究者。


不同学科和领域的实际研究已经在平台上展开:水坝群如何进行生态泄洪调度,钢材在未知地震加载下会有怎样的循环响应,低成本空气质量监测网络如何实现跨站点校准、城市干道协同控制、金融市场高频流动性建模,还有 AI 模型的后训练。


Novix 由石宇、汤嘉斌等人创立,核心成员来自 Google、微软、Meta、智谱和 Kimi,曾主导或参与 Microsoft Copilot、Kimi K2、AgentOS 和 AutoAgent 等项目。


这支华人团队为什么能率先把 RSI 推向全球规模化闭环?


答案在于,Novix 在产品、系统与算法层面,重新定义 AI 与人类顶智专家的协同进化关系。Novix 将这套机制称为 Co-Evolutionary RSI—— 协同进化式 RSI。


“机器负责加速边界的探索,人类把价值、审美和选择持续写进系统。” 石宇说。“两者共同组成一个持续运行、自我改进的智能进化系统。”


在这个回路里,AI 主动提出方向、展开解空间、执行任务并验证结果;专家持续反馈什么是重要的问题、什么证据足以成立、采用怎样的评价标准(rubrics),以及哪些方向符合自己的审美与长期判断。每一次采用、否决、纠偏和反馈,都会成为下一轮探索的新目标与新标准,并进一步改进系统的任务分解、工具使用、harness 与模型能力。


真实高难任务持续暴露系统的能力边界,专家反馈不断推动系统进化,进化后的 AI 再去解决更难的问题。Novix 规模化的,正是这个在前沿算法与工程领域中持续运行的 RSI 飞轮。


石宇说:“能真正把 RSI 做到规模化的,一定是最能杠杆人类顶尖专家审美的系统。”


让每位科学家都有自己的 AI 自主实验室


Novix 在与全球专家的持续协作中,学习每位研究者关注的问题、判断证据的方式与探索偏好,再主动提出候选方向并完成验证。科学家在关键节点选择继续、暂缓或纠偏,也可以重新定义评价标准;这些判断随即成为下一轮探索的起点。


把这种关系放进一个典型的材料研究场景:一位 PI 不必每天给系统写出完整任务,只需在候选方向中判断哪些值得推进、哪些证据不足、哪些异常值得追问;余下的探索、实验和验证由 AI 持续展开。随着判断不断积累,系统逐渐形成贴合这位研究者的探索路径。


为了探索那些连人类都尚未知晓答案的领域,最重要的是研究解空间中最值得推进的下一步。科学家的每一次选择,都在告诉系统什么是好问题、怎样判断证据、愿意承担怎样的风险,以及什么结果真正有价值。同一个基础模型,因此会沿着不同专家的 taste 生长出不同的探索路径。


全球竞逐RSI,这支华人团队已跑通规模化闭环


全球竞逐RSI,这支华人团队已跑通规模化闭环

不同领域的人机协同进化环境。在酶工程(图上)中,一个 “提高工业酶性能” 的目标,逐步变成关于突变组合、实际反应条件和实验取舍的具体问题;在离散扩散语言模型(图下)中,一个新型文本生成方向,逐步展开为训练、生成速度、推理能力等不同研究路线


汤嘉斌表示:“通用模型倾向于提出近似相同的问题分布,而人类专家的反馈才是决定 RSI 系统在探索人类未知时的种子变量。”


协作越久,任务分布、判断标准、失败记录和探索脉络越完整,最终沉淀为属于个人或实验室难以复制的研究资产和数据壁垒。这些数据保留在专属空间中,只服务于对应的用户或组织。


会做,正在成为 Agent 的标配;知道什么值得做,才是探索式智能的分水岭。Novix 不等待科学家交付一张完整的任务清单,而是持续发现、筛选并验证值得推进的下一步。


当 AI 把执行与验证的边际成本压到接近于零,决定研究上限的就不再是 “能试多少次”,而是 “知道什么值得试”。执行被无限放大,科学家的 taste 就成为智能进化的方向盘。


Novix 想要放大顶尖专家判断的作用半径。过去,这样的判断可能只能影响一名学生、一个项目或一次实验,如今被转化为持续驱动 AI 探索知识边界的系统变量。


团队产品合伙人施蓓提到 “衡量这套系统的尺度,不是一次完成多少任务,而是专家的一次判断能把探索推进多远。”


三个前沿任务中的 RSI 闭环


方向确定后,Novix 会组织多个 Agent 调度算力、处理数据、设计方法、搭建环境并运行训练或仿真。科学家不必介入每次工具调用,只在证据、标准或方向需要变化时介入。石宇把科学家一次判断所能支撑的探索方向的优化,称为 “人类审美的杠杆”。


前沿科研不是把既定任务一路跑到底:实验会推翻假设,新证据会迫使系统修改策略,局部指标的提升也可能让研究偏离真正的问题。“产品与系统机制的设计必须容纳这个过程。” 石宇说。


因此,Novix 把材料、目标、评价标准、工具调用、中间产物和失败记录保留在同一工作空间。研究者不必盯住每一步,却能在需要时追溯系统为什么修改参数、哪条路径失败、偏差从哪里出现。失败不是被清理的噪声,而是系统资产:它既告诉 Agent 哪条路走不通,也暴露工具、环境、评估器和模型还缺什么。


三个公开任务提供了更具体的观察窗口:训练模型、调度复杂基础设施、预测材料在未知工况下的响应。它们过去都高度依赖顶尖专家的持续参与。


让 AI 自主端到端完成模型后训练


这是 RSI 核心的一类任务:Agent 直接参与模型能力的训练与选择。Novix 自主完成数据构造、训练代码、SFT、GRPO 或 RFT、检查点比较与最终交付。在 SynLogic 的 135 道固定评测题上,Qwen2.5-7B 准确率从 8.89% 提升至 37.78%;在 ScienceWorld 的 30 项代表任务中,Qwen2.5-7B-Instruct 平均得分从 11.2667 提升至 35.6333。


全球竞逐RSI,这支华人团队已跑通规模化闭环


过程中还有一次堪称 “神来之笔” 的判断:后续强化学习的训练 loss 仍在下降,Novix 却发现模型在真实任务探针中的得分从 38.7 跌至 21.1—— 模型只是更会拟合训练轨迹,却没有变得更会解决问题。Novix 主动否决了这次更新,恢复并交付表现更好的模型。AI for AI 最关键的能力,不是让每一轮训练都继续,而是判断模型是否真的变得更聪明,并在必要时停止、回退和重新选择进化方向。


全球竞逐RSI,这支华人团队已跑通规模化闭环


更重要的是,这些训练任务不只改进被训练的模型。数据、日志、失败路径与评测结果也会回流 Novix,用于改进它自身的任务分解、工具选择、评估器和模型,由此形成 AI for AI 的递归闭环。


在多约束情况下求解联邦水坝耦合控制


在一项基于真实河流记录的泄洪调度模拟任务中,Novix 需要为哥伦比亚河与斯内克河上的八座水坝逐小时分配泄洪量。泄洪能帮助幼鱼绕开发电机组,却会抬高水中的总溶解气体,带来生态风险;上游的调整还会延迟影响下游。


在约 3.57 小时的有效用时内,Novix 完成了 578 次工具调用,反复数据处理、算法开发、运行实验,并根据反馈持续修正预测与控制策略。它发现一处气体传播时距被错误设为 44 小时,重新推导后将其修正为 16 小时;还发现,预测误差降低并不必然改善调度效果,于是放弃跨季节表现不稳定的方案,转而根据预测误差对调度成本的影响重新设计优化目标。候选方案形成后,验证仍在继续 —— 它不仅检查预测是否准确,还检验这些预测能否带来更好的决策。


全球竞逐RSI,这支华人团队已跑通规模化闭环

Novix 在发电要求、气体上限和复杂运行规则之间,找到八座水坝协同运行的控制策略。


最终,Novix 在研究期间不可见的 16 个独立测试周中取得 0.719264 的得分,较题方专家参考方案高出 6.50%,所有控制指令均通过执行约束检查。它交付的不是一份泛泛的调度建议,而是一套能够逐坝、逐小时输出决策的可执行控制器。这个案例展示了 Novix 如何通过持续调用工具、纠正预测和调整策略,把一个复杂问题推进到经过验证、可以运行的结果。


预测钢材在未知地震加载下的循环响应


地震发生时,钢结构会反复承受拉伸和压缩。要预测它在这样的过程中如何变形,不能只看某一次受力:此前经历了什么,也会影响材料接下来的表现。因此,从已有试验中建立的模型,能否适用于另一种受力过程,是材料研究中需要检验的问题。


Novix 从已有拉伸和循环试验出发,自主提出本构假设、修改数值实现并反复验证。在 60 个研究期间不可见的加载历程上,它取得 0.620034 的题方保留测试得分,约为专家参考解 0.310910 的 1.99 倍,所有实例均返回有效结果。


全球竞逐RSI,这支华人团队已跑通规模化闭环


全球竞逐RSI,这支华人团队已跑通规模化闭环

60 个实例全部生成有效结果,且全部超过基础方案。证明 Novix 能够从有限的既有试验中提出本构假设、构建模型、完成参数标定,再把获得的材料规律迁移到从未见过的加载路径上


这些任务的共同点在于,答案无法一次生成,必须在实验、失败和评价中不断收敛。


而每一次收敛留下的数据、失败路径与专家判断,都会回流系统,成为下一轮探索的起点。这也正是 RSI 闭环在真实任务中的样子。


更强智能时代的人机关系


石宇曾在微软参与 Microsoft Copilot 从零到亿级用户的增长,并作为 MS AgentOS 创始产品经理推进前沿 AI 产品化。汤嘉斌拥有香港大学博士学位,曾参与 Kimi K2 后训练,并主导 AutoAgent 和 AI-researcher 开源项目。


团队其他成员包括来自 Meta、微软的算法研究人员,以及具有 Google、微软和 Amazon 产品经验的成员,覆盖模型后训练、Agent 系统、基础设施与产品设计。这组背景也解释了 Novix 团队为什么会把模型改进、Agent 系统和用户长期协作视为同一个问题。


他们在实践中愈发感到,顶级专家不是一份等待 AI 提取完毕的静态知识库。他会被新证据说服,会对意外结果产生兴趣,也会放弃过去坚持的解释。AI 带回的新发现会改变人的判断,人的新判断又会改变 AI 的下一轮探索。Co-Evolution 让双方在不断出现的新问题中共同进化。


即便 Agent 有一天超越人类既有的智力边界,这种协同仍会继续产生价值。开放式任务的方向会在真实任务、专家反馈和新的科学发现中不断演化;越多具有不同 taste 的专家进入回路,系统获得的目标、标准和现实约束就越丰富,能够抵达的知识边界也越广。


更强的基础模型会抬高所有人的能力下限,却不会抹平不同研究者的问题意识。通用能力决定 AI 能做多少事,长期协作形成的 taste 决定这些能力被用于什么问题。两条能力轴线相互正交:基础模型越强,个体化探索引擎的分化价值反而越大。


RSI 越向前发展,人类最稀缺的判断越会成为智能递归的关键变量。


Novix 已经把这场 Co-evolution 做成了一座每个科学家都能拥有的 AI 自主实验室。在这里,AI 不知疲倦地展开探索,科学家不断收获研究成果,用并自己的 taste 决定什么值得进入下一轮研究。


这也是 Novix 正在验证的协同进化 RSI 路径 ——AI 探索未知,人类选择未来。


文章来自于"机器之心",作者 "机器之心"。

关键词: AI新闻 , Novix.science , RSI , Novix
AI转型,免费服务,就找AITNT
AITNT资源拓展
根据文章内容,系统为您匹配了更有价值的资源信息。内容由AI生成,仅供参考
1
智能体

【开源免费】AutoGPT是一个允许用户创建和运行智能体的(AI Agents)项目。用户创建的智能体能够自动执行各种任务,从而让AI有步骤的去解决实际问题。

项目地址:https://github.com/Significant-Gravitas/AutoGPT


【开源免费】MetaGPT是一个“软件开发公司”的智能体项目,只需要输入一句话的老板需求,MetaGPT即可输出用户故事 / 竞品分析 / 需求 / 数据结构 / APIs / 文件等软件开发的相关内容。MetaGPT内置了各种AI角色,包括产品经理 / 架构师 / 项目经理 / 工程师,MetaGPT提供了一个精心调配的软件公司研发全过程的SOP。

项目地址:https://github.com/geekan/MetaGPT/blob/main/docs/README_CN.md

2
知识库

【开源免费】FASTGPT是基于LLM的知识库开源项目,提供开箱即用的数据处理、模型调用等能力。整体功能和“Dify”“RAGFlow”项目类似。很多接入微信,飞书的AI项目都基于该项目二次开发。

项目地址:https://github.com/labring/FastGPT