过去两年,大模型几乎重写了人机协作的默认想象:写代码、查资料、做分析,似乎都能 “一问即答”。但仔细看会发现,当下很多能力并不是模型自己长出来的,而是人为地在外面包了一层又一层框架。
人类先定流程、写 Skills、建知识库;参数继续变大,工具链继续变厚。Agent、Skills、Function Calling、RAG、Harness 轮番上场,把临时判断固化成可调用的工作流。这套做法有效,也撑起了眼下的繁荣。
问题在于,能力上限往往卡在脚手架上。换场景就要重写流程,换工具就要重排提示和权限。系统看起来更能干,知识却越来越多地挂在流程外面。另一条路更接近人类怎么学:复盘成败,把结构相近的问题连起来,把一次有效推理留到下次还能用。
现在主流方案多停在接口与检索,很少把 “经验怎么复用” 写进推理本身。外挂和算力人人都能堆,更难的是,让模型在新问题上自己调用旧经验。我们把这条路线命名为 “启发学习(Inspirational Learning)”,并把它集成到推理侧,取名 Isaac(源自牛顿的名字,寓意 “站在巨人肩膀上”)。
近现代科学史里,重大突破很少从零开始。例如,库仑受牛顿万有引力思维模式启发,提出库仑定律;霍兰德把达尔文自然选择的逻辑迁移到计算机领域,遗传算法随之出现。最常见的路径,是把已知结构搬到新领域:类比、迁移、再重组。

图 1-a:库仑受牛顿万有引力思维模式启发,提出库仑定律。

图 1-b:霍兰德借达尔文自然选择逻辑,发展出遗传算法。

图 2:启发学习的认知进化飞轮。类比检索、逻辑重组、内生注入与经验沉淀形成闭环。
图 2 给出了启发学习的四个步骤:类比检索(Analogical Retrieval)、逻辑重组(Re-composition)、内生注入(Endogenous Injection)和经验沉淀(Experience Loop)。面对新领域、新问题,检索聚焦的不是字面相似的文本,而是经验库里其它领域解答过的类似问题的思路;注入阶段把这些思路整理后合并进当前输入;沉淀阶段再把新题的思维链抽象成可复用条目,写回经验库。我们把该流程集成形成推理侧框架 Isaac:不改基座权重,也不重新训练,只在推理时注入跨领域经验。模型还是原来的模型,但解题时旁边多了一批 “结构相近的旧题” 来做指导、做参考。
要把启发学习跑起来,先得说清经验从哪里输入模型。团队把它拆成两条路,Prompt 注入:基座参数不动,把检索到的跨域示范写进上下文,让模型在给定示范下推理。网络层注入:基座仍冻结,但在中间层隐状态上加一个可训练的轻量适配器,用残差方式改表征,减轻源域与目标域的分布差距。对应团队提出的工作分别是域不变神经元检索(DIN-Retrieval,下称 DIN)和思维链引导的域适配(CoDA),合在一起构成 Isaac 的方法底座。

图 3:DIN 框架(Prompt 注入)。识别域不变神经元,构造 DIN 向量并检索跨域示范,再写入上下文提示。图片来源:DIN-Retrieval 论文。
DIN 做的是 Prompt 注入,核心是示范怎么选。源域有标签、目标域无标签时,先对隐状态做 token 均值,再按源、目标联合分布算神经元级 z-score;两侧激活极性一致、且超过阈值的维度,称为域不变神经元(必要时只保留幅度最大的前 K 维)。只用这些维度构造向量,在子空间里用余弦相似度找源域示范,并用 MMR 去掉太像的重复样本。示范与目标查询拼成提示后送进冻结基座。这样一来,跨域检索不再只靠文本嵌入是否相近,而是看域更稳的子空间里结构是否对齐。

图 4:CoDA 框架(网络层注入)。轻量适配器以残差方式调制中间隐状态;均方误差蒸馏源域思维链教师态,MMD 对齐源域与目标域增强表征。图片来源:CoDA 论文。
CoDA 做的是网络层注入。只把示范塞进提示,有时不够:源域和目标域差得大,共享推理模式仍难复用。做法是把冻结大模型按层拆开,前面抽特征、后面生成,中间插适配器,残差调制隐状态(增强态 = 原隐状态 + 适配器输出)。源域用 “问题 + 思维链” 得到教师隐状态;源域与目标域的原输入经适配器后得到学生增强态。训练两项损失一起优化:均方误差让源域增强态靠近教师态,MMD 对齐源、目标增强态分布。推理时基座仍冻结,只对目标输入过适配器,也不需要目标域思维链标注。和纯检索式上下文学习相比,这一步把迁移做到了中间表征上。
图 3、图 4 分别对应两条路:DIN 负责找对齐的示范并写入提示;CoDA 在隐空间里对齐推理相关表征,服务无标签目标域。可以先检索再适配,也可以按能不能训中间模块、能不能读隐状态,二选一。Isaac 把它们放在推理侧:基座权重不变,靠 Prompt 注入和(或)网络层注入复用旧经验。下面先看评测设置,再看增益。
评测基准:编程、推理、科学问答与科研编码
实验用了四个公开热门基准,用以全方位评价启发学习的解题能力,特别是解难题的能力。HumanEval 测函数级代码生成:按函数签名与说明补全 Python,用单元测试判对错。StrategyQA 测隐式多跳推理:题是是非题,但不写出推理步骤,模型得自己补策略。ScienceQA 测科学问答:题来自中小学科学课,多为选择题,部分带图。SciCode 测科研编程:题从真实科研流程拆成子任务,要把领域知识写成能跑的代码。四个任务覆盖编程、策略推理、科学问答和科研代码,后面的对比都基于这套设置。
从数据里各摘一例,方便对照题型:
HumanEval(HumanEval/127)-- 实现 intersection (interval1, interval2):判断两闭区间交集长度是否为素数,返回 “YES” / “NO”。例如 intersection ((-1, 1), (0, 4)) 应返回 “NO”。
StrategyQA -- Does citrus grow well in places with 24-hour days in the summer?(答案:no)。题面是是非题,但不给推理步骤,需要自己补出 “极昼地区的气候与光照是否适合柑橘” 这类隐含链条。
ScienceQA -- Which better describes the Daintree rain forest ecosystem? 配图选择题。选项有 “全年温暖、生物多样” 和 “冬季寒冷、土壤肥沃” 等;正确答案是前者,要结合图像与选项判断。

图 5:ScienceQA 示例题配图(Daintree rain forest)。题目要求判断哪一项更准确地描述该生态系统。
SciCode(problem CG) -- 实现共轭梯度法 cg (A, b, x, tol),求解对称正定线性系统 Ax = b。任务拆自真实数值计算流程,输出需通过数值测试。
实验效果:标准基准上的增益
我们对比了主流大模型的零样本接口与接入 Isaac 后的表现。HumanEval 上,Claude 达到 100.0%(公开榜首约 95.1%);StrategyQA 上,Qwen3-8B 达到 82.3%,接近公开 SoTA;ScienceQA 上,Doubao 达到 98.0%(公开榜首约 91.3%);SciCode 等科研编程任务上,多家模型也有稳定正向增益。
按模型看,增益并不均匀。同一套接入方式下,较弱模型的绝对提升往往更大:StrategyQA 上 Grok-4.5 提高 13.5 个百分点,ScienceQA 上 Gemma-4-31B 提高 12.7 个百分点,HumanEval 上 14B 级模型提高 8.5 个百分点;更强的模型仍可能继续抬高上限。
以上实验数据说明,大模型提质不见得只靠预训练或后训练侧的 scaling。在推理侧复用跨域经验,也能大幅提高任务性能,是一条与堆参数、堆算力并行的路线,也是一条可单独检验的路线。




图 6:跨模型零样本(灰)与接入启发学习 / Isaac(蓝)后的增益。a,StrategyQA;b,ScienceQA;c,HumanEval;d,SciCode。图片来源:Inspirational Learning Pitch Deck。
从会补证据,到会复盘、会举一反三
启发学习想解决的,不是再给模型多接一个工具,而是让它在新题上复用旧经验。现有多个基准上,这条路带来了跨模型、跨任务的大幅增益,我们相信,该方法可以在更广泛的任务上普适和泛化。
外挂和算力还会继续加,与此同时,更值得做的是把复盘和举一反三做成稳定能力,将大模型的认知从外化迁移到内生,让模型激活自身的学习能力,实现真正的自我进化,这也是我们认为启发学习能为整个 AI 行业做出的贡献。
团队文章:
作者简介
颜见智, 2022 年获得吉林大学概率论与数理统计专业硕士学位,现为哈尔滨工业大学和鹏城实验室联合培养计算机科学专业博士研究生。研究方向主要集中在自然语言处理、统计机器学习、大模型压缩及大模型推理优化等领域,已在 ACL 和 EMNLP 上发表了多篇论文。邮箱:yanjzh@pcl.ac.cn
文章来自于"机器之心",作者 "颜见智"。
【开源免费】字节工作流产品扣子两大核心业务:Coze Studio(扣子开发平台)和 Coze Loop(扣子罗盘)全面开源,而且采用的是 Apache 2.0 许可证,支持商用!
项目地址:https://github.com/coze-dev/coze-studio
【开源免费】n8n是一个可以自定义工作流的AI项目,它提供了200个工作节点来帮助用户实现工作流的编排。
项目地址:https://github.com/n8n-io/n8n
在线使用:https://n8n.io/(付费)
【开源免费】DB-GPT是一个AI原生数据应用开发框架,它提供开发多模型管理(SMMF)、Text2SQL效果优化、RAG框架以及优化、Multi-Agents框架协作、AWEL(智能体工作流编排)等多种技术能力,让围绕数据库构建大模型应用更简单、更方便。
项目地址:https://github.com/eosphoros-ai/DB-GPT?tab=readme-ov-file
【开源免费】VectorVein是一个不需要任何编程基础,任何人都能用的AI工作流编辑工具。你可以将复杂的工作分解成多个步骤,并通过VectorVein固定并让AI依次完成。VectorVein是字节coze的平替产品。
项目地址:https://github.com/AndersonBY/vector-vein?tab=readme-ov-file
在线使用:https://vectorvein.ai/(付费)
【开源免费】AutoGPT是一个允许用户创建和运行智能体的(AI Agents)项目。用户创建的智能体能够自动执行各种任务,从而让AI有步骤的去解决实际问题。
项目地址:https://github.com/Significant-Gravitas/AutoGPT
【开源免费】MetaGPT是一个“软件开发公司”的智能体项目,只需要输入一句话的老板需求,MetaGPT即可输出用户故事 / 竞品分析 / 需求 / 数据结构 / APIs / 文件等软件开发的相关内容。MetaGPT内置了各种AI角色,包括产品经理 / 架构师 / 项目经理 / 工程师,MetaGPT提供了一个精心调配的软件公司研发全过程的SOP。
项目地址:https://github.com/geekan/MetaGPT/blob/main/docs/README_CN.md
【开源免费】FASTGPT是基于LLM的知识库开源项目,提供开箱即用的数据处理、模型调用等能力。整体功能和“Dify”“RAGFlow”项目类似。很多接入微信,飞书的AI项目都基于该项目二次开发。
项目地址:https://github.com/labring/FastGPT
【开源免费】graphrag是微软推出的RAG项目,与传统的通过 RAG 方法使用向量相似性作为搜索技术不同,GraphRAG是使用知识图谱在推理复杂信息时大幅提高问答性能。
项目地址:https://github.com/microsoft/graphrag
【开源免费】Dify是最早一批实现RAG,Agent,模型管理等一站式AI开发的工具平台,并且项目方一直持续维护。其中在任务编排方面相对领先对手,可以帮助研发实现像字节扣子那样的功能。
项目地址:https://github.com/langgenius/dify
【开源免费】RAGFlow是和Dify类似的开源项目,该项目在大文件解析方面做的更出色,拓展编排方面相对弱一些。
项目地址:https://github.com/infiniflow/ragflow/tree/main
【开源免费】phidata是一个可以实现将数据转化成向量存储,并通过AI实现RAG功能的项目
项目地址:https://github.com/phidatahq/phidata
【开源免费】TaskingAI 是一个提供RAG,Agent,大模型管理等AI项目开发的工具平台,比LangChain更强大的中间件AI平台工具。
项目地址:https://github.com/TaskingAI/TaskingAI
【开源免费】LangGPT 是一个通过结构化和模板化的方法,编写高质量的AI提示词的开源项目。它可以让任何非专业的用户轻松创建高水平的提示词,进而高质量的帮助用户通过AI解决问题。
项目地址:https://github.com/langgptai/LangGPT/blob/main/README_zh.md
在线使用:https://kimi.moonshot.cn/kimiplus/conpg00t7lagbbsfqkq0