在社会变化的洪流中,LLM 能不能不断修正自己对社会的认知?
伊利诺伊大学厄巴纳 - 香槟分校(UIUC)的研究者在名为 Social World Model(ICML 2026:https://arxiv.org/abs/2606.11482)的框架中提出并初步探讨了这一问题。他们以Polymarket 和 Kalshi 等预测市场为天然检验场,观察当突发新闻降临时,市场参与者的信念将如何发生偏移。
但这只是第一步。UIUC 联合来自清华的初创团队 Astraculum 决定发起一项更硬核的挑战并获得了一些初步结果:LLM 的认知更新,能否不仅停留在 “训练时(Train-time)” 阶段,而是真正延伸到 “部署(Deployment-time)” 阶段?
换句话说,当 LLM 被置于持续流动的市场数据与实时新闻中,它能否根据不断到来的真实反馈持续学习,让今天经历过的市场变化,真正改变它明天的判断?为了验证这一点,联合团队在长达 390 天的真实数据上进行了滚动训练与持续回测。结果证明了 “持续进化” 的力量:这个在部署后依然不断更新权重的 Model,在同等测试环境下,一举击败了 GPT-5.6、DeepSeek V4 Pro 以及 Claude Opus 5 等一众前沿模型。
如果物理世界模型(Physical World Model)能根据物体的 “当前状态(如速度和位置)” 预测它受力后的轨迹;那么当突发新闻降临时,AI 能不能预测人类社会的集体认知会发生怎样的转移?这就是 Social World Model (SWM) 试图解决的问题。
为了量化 “社会认知”,SWM 将目光投向了 Polymarket 和 Kalshi 等预测市场。这是因为预测市场只围绕尚无定论的问题形成,参与者广泛多样,无数普通人真金白银的押注,能最敏锐地反映大众 “集体信念” 的移动,比问卷和社交媒体都更可靠。
在这个框架下,“社会认知如何更新” 被完美映射成了世界模型中最经典的状态转移(State Transition)。以 “美联储九月是否降息” 为例:
模型的目标不是去预测美联储到底降不降息,而是预测大众在特定情形下的反应:在当前的状态下,刚发生的新闻会将大众的信念改变多少?换句话说,它学习的是: 当前信念 + 突发事件 → 下一时刻的信念。
为了把 Social World Model 从离线实验推向真实环境,研究团队让 SWM 直接接入实时新闻源和预测市场盘口。具体来说,在每一个预测时刻,LLM 都可以看到此前的市场状态以及刚刚出现的新闻,然后判断接下来市场的集体信念会朝哪个方向移动。
比如,在 2026 年 2 月 13 日下午 2 点的一条样本中,市场正在预测 “标普 500 是否会触及 6000 点”,当时合约价格为 0.525。此时,Agent 可以看到过去 24 小时的价格走势,同时读取过去一小时内刚刚发布的新闻。它需要在下一小时结果真正发生之前判断这些新信息里,有没有尚未被市场价格充分反映的内容?如果有,它会把市场信念推向哪里?

如果模型参数始终被冻结,那么它今天从市场中看到的经验,并不会自动成为明天模型能力的一部分:每一次预测都由同一个模型作答,上一次的对错与下一次无关。真正的长期部署因此带来了下一层问题:模型能否把部署过程中不断获得的真实反馈重新写回参数,让过去的经历持续改变未来的判断?
现实世界中的社会认知和市场逻辑并不是静止的。新闻的重要性会变化,市场参与者的反应模式会变化,宏观环境也会变化。这种变化不由我们安排,也不会提前通知:模型自己不会报告它已经跟不上了。一个参数冻结在某个时间点的模型,很难保证能适应之后潜在的变化。因此,对于 Social World Model 来说,持续学习(Continual Learning)并不仅仅是一种训练技巧,而是长期部署中必须具备的能力。
那么,每小时到来的市场反馈,该让模型学什么?面对预测市场的涨跌,最直觉的做法是让模型直接根据 “价差” 来修正权重。但这会掉入噪声的陷阱。对于突发新闻引发的市场剧变,数字只是一种表象。它告诉模型的是:“市场最后动了多少。” 却没有直接告诉模型:“哪些新闻真正重要?”“为什么这条新闻会改变市场参与者的判断?”“市场究竟是在更新哪一种对世界的理解?” 因此,更可靠的路径是:跳过单纯的数值拟合,直接让模型去学习 “新闻事件” 与 “信念变动” 之间的逻辑推理过程。
引入 SDFT 机制:利用 “特权信息” 指导推理
为此,团队采用了类 SDFT(Self-Distillation Enables Continual Learning,https://arxiv.org/abs/2601.19897)的方法来进行推理过程的自蒸馏。这套机制巧妙地利用了 Hindsight 的 “特权信息(Privileged Context)” 来构建师生闭环。特权信息只用来教,不用来答:预测永远由没看过结果的学生独立完成。
具体而言,当一小时后的真实市场结果揭晓时,系统首先会让模型根据真实变化写出一段事后推演。随后,同一个模型在训练中被分为 “老师” 和 “学生” 两角:
在蒸馏阶段,老师逐 Token 地给学生的推理打分,把学生拉向看过结果之后的判断:学生还在说 “继续稳定”,老师已经压向 “正式延期”。这样刻进参数的是 “客观事件 → 大众情绪 → 市场动作” 这条链,而不是某一次的价格数字。

为了验证这套机制的实效,团队选取了长达 390 天的真实市场数据,并按月切分为多个窗口。模型在每个月的数据上进行自蒸馏迭代与滚动部署。也就是说,整个实验严格按照时间向前滚动:部署 → 获得真实反馈 → 训练 → 更新模型 → 继续部署。
部署表现:持续学习让 7B 模型跑赢前沿模型 面对真实的资讯洪流,GPT-5.6、DeepSeek V4 Pro 等静态大模型全部跌穿了只看价格、不看新闻的基线。而通过持续自蒸馏的 7B 模型,是全场唯一比价格基线预测得更准的。

制胜关键:跨越周期的稳定性 将全年数据按月拆分后可以看出,性能的提升本质上来源于稳定:静态大模型在遇到特定月份(如 w01、w11)的变动时会集体大幅失分,而 7B 模型十二个月里没有一个月大幅失守。

更新有没有让模型变坏 实验也做了检查:每一轮训练后都冻结一份副本作为对照,并在无关任务上探针;十二轮下来,模型的推理长度和质量没有退化。
LLM 在预测市场的部署只是冰山一角。 任何想让大模型跳出实验室、在真实世界的动态数据中实现持续学习的团队,都会不可避免地撞上三堵工程高墙:
为了把这套逻辑跑通,研究团队搭建了 TrajOps:一个专为持续学习设计的标准化 MLOps 引擎。从工程落地的角度来看,TrajOps 的核心其实非常务实且简洁:它向上层提供了三个接口:Collect(收集)、Inference(推理)、Train(训练),并直接在底层工作流中适配了标准的 SDFT(Self-Distillation Fine-Tuning,自蒸馏微调)方案。
整个循环在这个引擎上被清晰地串联了起来:
目前,这个 7B 模型依然依托于这套 Infra 在真实市场中持续判断,每天写下实盘记录,公开在 trajops.astraculum.com。
以下为这项研究的作者及机构:
文章来自于"机器之心",作者 "机器之心"。
【开源免费】字节工作流产品扣子两大核心业务:Coze Studio(扣子开发平台)和 Coze Loop(扣子罗盘)全面开源,而且采用的是 Apache 2.0 许可证,支持商用!
项目地址:https://github.com/coze-dev/coze-studio
【开源免费】n8n是一个可以自定义工作流的AI项目,它提供了200个工作节点来帮助用户实现工作流的编排。
项目地址:https://github.com/n8n-io/n8n
在线使用:https://n8n.io/(付费)
【开源免费】DB-GPT是一个AI原生数据应用开发框架,它提供开发多模型管理(SMMF)、Text2SQL效果优化、RAG框架以及优化、Multi-Agents框架协作、AWEL(智能体工作流编排)等多种技术能力,让围绕数据库构建大模型应用更简单、更方便。
项目地址:https://github.com/eosphoros-ai/DB-GPT?tab=readme-ov-file
【开源免费】VectorVein是一个不需要任何编程基础,任何人都能用的AI工作流编辑工具。你可以将复杂的工作分解成多个步骤,并通过VectorVein固定并让AI依次完成。VectorVein是字节coze的平替产品。
项目地址:https://github.com/AndersonBY/vector-vein?tab=readme-ov-file
在线使用:https://vectorvein.ai/(付费)
【开源免费】AutoGPT是一个允许用户创建和运行智能体的(AI Agents)项目。用户创建的智能体能够自动执行各种任务,从而让AI有步骤的去解决实际问题。
项目地址:https://github.com/Significant-Gravitas/AutoGPT
【开源免费】MetaGPT是一个“软件开发公司”的智能体项目,只需要输入一句话的老板需求,MetaGPT即可输出用户故事 / 竞品分析 / 需求 / 数据结构 / APIs / 文件等软件开发的相关内容。MetaGPT内置了各种AI角色,包括产品经理 / 架构师 / 项目经理 / 工程师,MetaGPT提供了一个精心调配的软件公司研发全过程的SOP。
项目地址:https://github.com/geekan/MetaGPT/blob/main/docs/README_CN.md
【开源免费】XTuner 是一个高效、灵活、全能的轻量化大模型微调工具库。它帮助开发者提供一个简单易用的平台,可以对大语言模型(LLM)和多模态图文模型(VLM)进行预训练和轻量级微调。XTuner 支持多种微调算法,如 QLoRA、LoRA 和全量参数微调。
项目地址:https://github.com/InternLM/xtuner