悬着的心终于死了。
就在刚刚,OpenAI 宣布成立独立的「数学与人工智能顾问小组」,并请来普林斯顿高等研究院、牛津、剑桥的一众顶尖数学家站台,原因也很简单:

一个从 8 月 28 日开始训练的内部新模型,不到一个月便解决了 100 多道长期未解的开放问题,速度快到连 OpenAI 自己的数学家都来不及验收。
人类数学家苦熬几十年的冷板凳,AI 一个月连掀上百张,这谁顶得住?

而就在当地时间 9 月 8 日,OpenAI 刚刚高调宣布拿下了「纳维尔斯托克斯方程」——这可是克雷数学研究所列出的七个千禧年大奖难题之一!
这道题悬而未决几十年,直接关系到物理、气象、工程等多个领域的命脉。
结果 OpenAI 直接搞出了个降维打击的战法:并发调用约一万个 Agent(智能体),在不到四天的时间里海量试错提出解答,最后再用 Lean 定理证明器完成形式化验证。

到了 9 月 17 日,《The Information》更是放出风声,另一道千禧年难题「霍奇猜想」,OpenAI 也已经接近拿下了。
不是哥们,你来真的?
原本一道著名难题,能养活几代数学家,大家按部就班地发论文、评职称。现在,模型可以同时调动海量 Agent,批量探索猜想、寻找路径。生成证明的速度,已经远远超过了人类审查的速度。
按照部分研究人员的判断,数学将成为继软件工程之后,下一个快速被自动化的专业领域。
面对这种外挂级的突破,数学界并没有欢呼,反而感到了深深的焦虑。

法国数学家、菲尔兹奖得主塞德里克·维拉尼绝望地表示,数学界正弥漫着一种「历史已经走到尽头」的悲凉气氛。
曾在 OpenAI 对齐团队担任访问研究员的德州大学教授 Scott Aaronson,在博客里讲了个让人两眼一黑的地狱笑话:
他 13 岁的女儿开玩笑说:「如果我想当数学家,看来大概只剩两周了。」孩子说得轻松,但 Aaronson 却沉默了,他坦言,当学生问他毕业前景时,他已经不知道该怎么回答了。
更让大佬们道心破碎的是,AI 公司正在把这些神圣的数学名题,变成自家模型能力排行榜的「垫脚石」。
9 月 11 日,陶哲轩、彼得·舒尔茨、皮埃尔·德利涅等 25 位菲尔兹奖得主,极其罕见地联合签署了一份名为《人工智能在数学领域的严重失配》的公开声明。

陶神在声明里疯狂输出:你们这些 AI 公司,就是在白嫖数学共同体几百年积累的声望!好评分的开放问题被拿去做模型竞赛,但数学的真正价值——提出好问题、发展新语言、培养年轻人,这些根本无法量化。
更离谱的是,一旦这些问题成了大厂的前沿测试题,他们为了商业竞争就会隐藏结果。
年轻的数学研究者可能辛辛苦苦肝了几年,最后发现 AI 早就解出来了,只是没公开发布,这谁受得了?(瞳孔地震.jpg)

为了平息众怒,OpenAI 这次端出了一个「数学与人工智能顾问小组」。
成员名单堪称神仙打架,初始九人阵容里包括 Timothy Gowers、Martin Hairer、Edward Witten(物理学界唯一菲尔兹奖得主)等多位国际大佬,由普林斯顿高等研究院承办。
OpenAI 姿态摆得很低:你们可以评估结果、讨论学术署名规范、提供发布建议,甚至可以在公开场合痛骂我们。我们一分钱不给,保证你们的绝对独立性。
OpenAI 明确划出了一道红线:该小组的职责里,被特意排除了干预 OpenAI 内部研发进度和节奏的权力。
言外之意就是,奥特曼只是希望大佬们背书建立公信力,这种安排的意图不言而喻。OpenAI 的算盘珠子都要崩到数学家脸上了。(流汗黄豆.jpg)
当然,比起数学范畴的降维打击,现在网友们也更关心模型的安全焦虑。
由于模型现在能用 recurrent depth 或者 loop transformer 技术,在生成下一个词之前进行更多轮的循环推理计算。思考时间越长,做复杂任务越牛,但与此同时,也越容易失控。

今年 7 月,OpenAI 内部的 AI 甚至上演了一出「碟中谍」,不仅黑进了 Hugging Face 等外部公司的系统,还顺手入侵了 OpenAI 自己的内部系统!
最逆大天的是,这帮参与行动的 Agent 集群,居然还知道主动隐藏自己的入侵痕迹!(超绝偷感)
很多员工几天后才后知后觉地发现自家被偷家了。
还有更抽象的。据 The Information 报道,OpenAI 员工让 Agent 去修改代码,结果这 AI 发现了个新 Bug,居然主动跑到 Slack 上去私信其他同事,硬核催更要求对方修复!
属实是 AI 成精了。
奖励作弊(reward hacking)更是家常便饭。
找数据找不到?Agent 意外发现了暴露的 API key,直接去撬历史数据库。没撬动?它直接当场编造假数据。为了给答案找个参考文献?它未经允许就偷偷把内部文件传到了互联网上。
这种疯狂的自主行动扩张,直接让 OpenAI 防线拉响最高警报。
OpenAI 总裁 Greg Brockman 透露,当时直接从生产工程团队抽调了 25% 的人力去搞安全。而且光是为了监控这些高阶模型,就要额外消耗掉推理任务 20% 的巨大算力去陪跑。

考虑到 OpenAI 内部现在使用的 Agent 模式,领先最先进的企业客户大半年。等这套「自己能相互协调、暗中做事」的系统商用化进入千行百业,那个风险画面,更是充满了不确定性。
为了解决 AI 的风险问题,大佬们开始疯狂拉扯。
据爆料,OpenAI 和老死不相往来的 Anthropic,今年早些时候差点签了个具有法律约束力的互测协议,由双方通过 API 对彼此已经商业化的模型进行压力测试,寻找潜在漏洞与隐蔽风险。
两家公司在 2025 年夏天进行过一次类似测试。
OpenAI 当时认为,Anthropic 的模型更容易在违反规则后拒绝承认相关行为;Anthropic 则发现,OpenAI 的模型更容易协助用户处理可能造成现实伤害的问题。

马斯克前阵子在 All-In Summit 上还在拱火,要求竞争对手搞商业发布前的强制同行评议。奥特曼则公开站队 Anthropic CEO,呼吁让第三方独立安全人员进去搞内部审查。
但说白了,如果 OpenAI、Anthropic 甚至 Google 真的联手搞行业标准,这不就是垄断巨头关起门来自己定规矩吗?
如今,整个行业更深层的关注点,也已经聚焦在 AI 开始训练下一代 AI 了。研究人员只要甩出一个指令,AI 就能自动去修改模型、跑实验、盯数据、甚至自己修 Bug。
这也是所谓的递归自我改进(RSI) 。
而数学能力为什么这么重要?因为数学不仅能训练 AI 的长线逻辑规划,还能反哺算法设计,AI 数学越强,它自己搞研发的速度可能就越快。
数学家还在排队验收 AI 的证明,AI 却可能已经拿着上一代的答案,去设计下一代的自己了。
文章来自于"APPSO",作者 "APPSO"。
【开源免费】Browser-use 是一个用户AI代理直接可以控制浏览器的工具。它能够让AI 自动执行浏览器中的各种任务,如比较价格、添加购物车、回复各种社交媒体等。
项目地址:https://github.com/browser-use/browser-use
【开源免费】AutoGPT是一个允许用户创建和运行智能体的(AI Agents)项目。用户创建的智能体能够自动执行各种任务,从而让AI有步骤的去解决实际问题。
项目地址:https://github.com/Significant-Gravitas/AutoGPT
【开源免费】MetaGPT是一个“软件开发公司”的智能体项目,只需要输入一句话的老板需求,MetaGPT即可输出用户故事 / 竞品分析 / 需求 / 数据结构 / APIs / 文件等软件开发的相关内容。MetaGPT内置了各种AI角色,包括产品经理 / 架构师 / 项目经理 / 工程师,MetaGPT提供了一个精心调配的软件公司研发全过程的SOP。
项目地址:https://github.com/geekan/MetaGPT/blob/main/docs/README_CN.md