80亿参数记性不如U盘:他算出了大模型记忆天花板
80亿参数记性不如U盘:他算出了大模型记忆天花板一个80亿参数的大模型,一口气吞下15万亿token的训练数据,堆到硬盘上差不多7TB。可它真正「背」得下来的,少得可怜:每个参数只装得下3.6 bit。一个英文字母8 bit,连半个都填不满。
搜索
一个80亿参数的大模型,一口气吞下15万亿token的训练数据,堆到硬盘上差不多7TB。可它真正「背」得下来的,少得可怜:每个参数只装得下3.6 bit。一个英文字母8 bit,连半个都填不满。
Corgi,这家每周工作七天、在旧金山经营通宵咖啡馆的AI保险初创公司,再次从投资者那里获得了融资——不到三个月,已是第三次。多位知情人士告诉《福布斯》,本次融资对公司的估值为40亿美元,几乎是5月底以来其估值的两倍。
近日,独立开发者 Harshal Singh 公布了一个仅有 3500 万参数的基础语言模型 BarunLM,并声称:「我预训练了世界上参数量小于 100M 的最好模型」。
2025 年秋天,Meta 上线了一名可以替商家卖货的“AI 员工”。商家不需要重新整理一套资料,它会直接读取品牌过去发布的社交媒体内容、广告、商品目录和网站信息,自动学会这家公司卖什么、用什么语气和顾客说话。
近日,由清华大学深圳国际研究生院智能机器人实验室刘厚德教授领衔、王立博博士后担任 AI 首席研究员的大模型团队,正式发布了 VeriLoop Coder-E1—— 一款基于 Qwen3.6-27B 构建、面向仓库级代码修复与智能体式软件工程任务的开源垂类代码模型。
8月,一年一度的ChinaJoy又在上海落幕了。今年的主题是“与AI同游”,近900家企业参展,AI成了游戏之外最热的词。当所有镜头都聚焦在游戏时,一个“逆流而上”的展台引起了我们的注意——WPS。
“怎么全世界都在陪着12星座胡闹啊!”AI练习生马上就在要网友们的“打投”中出道了。注意看,在一档名为《12星练赛》的AI选秀节目中,白羊、狮子和射手三位火象星座练习生正在初舞台上展示唱跳实力。
GPT-5.6 Sol 推翻 100 多年前的麦克斯韦猜想,下一代模型突破 10 个!数学家菲利普·阿拉图恩、加文·鲍尔和马修·D·克瓦尔海姆于 2026 年 7 月 29 日在 arXiv 上发表论文,提到由 GPT-5.6 Sol 找到了一个反例,证明了 100 多年前的麦克斯韦猜想是假的。
Seltz为Agent自建一套持续更新的Web索引,让它能够及时看见公开网络中正在发生什么;AnySearch聚合开放Web和20多个垂直数据源,让Agent知道面对不同问题应该去哪里查;Octen则重写索引、排序和服务层,让Agent可以同时展开几十甚至上百次查询,更快、更大规模地看见信息。
机器之心编辑部 一道困扰学界几十年的开放问题,需要多少成本才能取得关键突破? OpenAI 给出的答案是,十道题加起来,约 2000 美元。 昨天下午,OpenAI 公布了一份颇为惊人的成绩单。其下一