80亿参数记性不如U盘:他算出了大模型记忆天花板
80亿参数记性不如U盘:他算出了大模型记忆天花板一个80亿参数的大模型,一口气吞下15万亿token的训练数据,堆到硬盘上差不多7TB。可它真正「背」得下来的,少得可怜:每个参数只装得下3.6 bit。一个英文字母8 bit,连半个都填不满。
搜索
一个80亿参数的大模型,一口气吞下15万亿token的训练数据,堆到硬盘上差不多7TB。可它真正「背」得下来的,少得可怜:每个参数只装得下3.6 bit。一个英文字母8 bit,连半个都填不满。
今日,华为开源基于昇腾NPU训练的盘古MoE模型openPangu-2.0-Pro。该模型是openPangu-2.0系列的最新开源模型,总参数规模5050亿,激活参数规模180亿,支持512K上下文长度,训练数据总量约34T tokens。另一轻量化模型openPangu-2.0-Flash已于6月12日开源,参数92亿,其中6亿为激活参数。
2026 年 4 月起,一位专营稀有书和低流通量图书的美国书商遇到了怪事:他店里的生意向来不算火爆,一周卖出二十本已经算不错,但最近,订单突然像洪水一样涌来,每周能卖几百本。最费解的是,买家只列出一份用国际标准书号(ISBN)索引的书籍清单,却从不询问品相,也不砍价。
最近,兔展智能联合北京大学、鹏城实验室研发的 UniWorld-View 登顶李飞飞团队 WorldScore 世界模型榜单(训练数据来自北大系初创企业元空智能),并完成国产昇腾算力适配与代码、权重开源。
数据市场的故事,正在进入新一轮周期。来自企业真实工作流的 Real-world Data,成为越来越多 AI Labs 争夺的新资源。比如 GitHub 就是典型的 Real-world Data,它几乎完整保留了一个问题从出现到解决的全过程。相比之下,今天绝大多数 Human Data 公司提供的,仍是人为构造的数据。
今天分享一家很新的公司,Mecka AI,Mecka AI 是一家给机器人公司提供训练数据的公司。更具体一点,Mecka AI 做的是“人类动作数据”。也就是说,Mecka 做的事情很像“机器人时代的 Scale AI”。
据外媒 The Information 报道:Meta 正在限制员工在 AI 模型构建中使用 Claude Code 和 Codex,原因是担心涉及模型蒸馏。 Meta 担心这些外部模型生成的内容,可能进入自家的训练数据或评测体系,从而引发所谓的模型蒸馏争议。
近年来,大语言模型展现出了越来越强的能力,从上下文学习(In-Context Learning, ICL)到复杂推理、代码生成,这些能力不断刷新人们对模型能力边界的认知。
就在最近,OpenAI扔出一篇重磅论文。他们发现,只教AI好好看病,它写代码居然也不作弊了。方法简单到离谱:拿5%的训练数据,教模型在回答健康问题时诚实、谨慎、知错能改。
偷师、借道、换血、误删……折腾到最后,xAI成了给对手供电的人。