Google被曝正在研发一颗新的服务器AI芯片,把Gemini固化到硬件里

AITNT-国内领先的一站式人工智能新闻资讯网站
# 热门搜索 #
Google被曝正在研发一颗新的服务器AI芯片,把Gemini固化到硬件里
6227点击    2026-07-21 10:52

刚刚,The Information报道,Google正在搞一颗代号「Frozen v2」的服务器芯片,打算把Gemini的部分架构直接固化进硬件里。


据知情人士的说法,这颗芯片每瓦功耗能输出的Token数,可能达到Google现有自研AI芯片的6到10倍,最快将于2028年部署。


模型,要被做成芯片了。


等等,模型是软件啊,软件怎么能「焊」进芯片?


赌赢了,Gemini的推理成本倒是是真有可能降一个数量级;但要赌输了,模型一换骨架,这芯片就变成技术包袱了。


而且,Gemini 3.5都还在难产,现在就敢把架构焊起来,下一代模型长得不一样怎么办。。


今天,咱们就把这事从头到尾捋清楚。


一、「焊进芯片」,焊的到底是什么


先解决第一个问题:软件怎么变成硬件?


一个大模型,拆开有两样核心的东西——


「权重」:几千亿个参数,决定模型知道什么;


「架构」:多少层、每层什么算子、数据按什么顺序流过哪些计算单元,决定模型怎么算。


按照目前披露的方案,Frozen v2想固化的是Gemini中相对稳定、反复执行的计算路径。


权重依然可以更新,模型也能继续训练;但「怎么算」这条主干,会被更深地写进电路。


Google被曝正在研发一颗新的服务器AI芯片,把Gemini固化到硬件里


通用芯片必须服务不同模型和任务,因此要保留足够的灵活性。每次运行时,编译器和芯片都要处理调度、数据搬运、缓存分配等一系列问题。


Frozen v2则更专业化。Gemini怎么算、怎么搬,出厂前就定死在电路里了。具体主要省在这三个地方:


  1. 少调度。专用芯片把固定流程直接做成电路,省掉大量指令解析和调度开销。
  2. 少搬运。计算路径固定后,缓存、带宽和数据流都能围着Gemini重新设计,让数据尽量少绕路。
  3. 敢压精度。通用芯片得给各种模型留余地;专用芯片可以针对Gemini常用的算子和数值格式做激进优化,用更低精度换更高吞吐。


这套思路,其实是Google的祖传手艺。


2015年,初代TPU干的就是这事——把CPU、GPU里AI用不上的通用功能全删了,芯片面积全让给矩阵运算,由此换来了几十倍的能效提升。


Google被曝正在研发一颗新的服务器AI芯片,把Gemini固化到硬件里


十年过去,Google准备把专用化再往前推一步:


GPU,保留较强的通用性,能够运行各种并行计算任务;


TPU,把重点收窄到AI常用的矩阵运算;


Frozen v2,准备删掉「兼容各种模型架构」这个包袱。


每收窄一层,芯片都会少做一些无用功,代价则是少兼容一些变化。效率越高,回头的余地越小。


方向,已经很清楚了:打造一颗专门伺候Gemini的芯片。


二、尴尬的是,Gemini自己还在难产


把一个模型的骨架焊进硅片,潜台词是:我对这个模型,有绝对的信心。


但就在这颗芯片曝光的几天前,Gemini 3.5 Pro,才刚刚延期。


这个新模型在Google内部有个代号,叫「Cappuccino」。


5月的I/O大会上,Google说6月上线。


6月过去了,没上线。


前几天,圈子里一度传它会在7月17日发布,结果等来的是——延期数月。


原因是编码能力没达到内部标准。Google虽然紧急更新了一波训练数据想抢救模型,但结果用彭博社的转述说——「令人失望」。


消息一出,Alphabet股价当天就跌超4%。


有前员工形容,Google的跨部门协调「就像试图煮沸整个大海」。


更扎心的是——因为GPU容量不够,Google自己的工程师,经常用不上自家的AI编码工具。


这个手握自研TPU、今年资本开支奔着1900亿美元去的Google,自己人也被算力卡脖子。


Google被曝正在研发一颗新的服务器AI芯片,把Gemini固化到硬件里


缺便宜的算力缺到这个份上,你就明白它为什么盯上了「焊芯片」这条最极端的省电路线。


但省电归省电,矛盾还是那个矛盾:


芯片最早2028年部署。


如果那之前Gemini只是换权重、扩规模,它仍然能继续跑;但如果底层计算方式变了,今天换来的高能效,明天就可能变成死胡同。


说来也巧,这对矛盾,Google自己用代号写得明明白白:Cappuccino,还在萃取;Frozen,准备冷冻。


起名的人,可能比谁都懂Google现在的处境。


三、Google在赌:大模型的架构,正在收敛。


一杯咖啡还没萃出来,怎么就敢冷冻?


因为在Google眼里,赔率已经变了。


最近几轮旗舰模型的更新,其实都没有早期那种肉眼可见的能力飞跃了——


沃顿商学院的教授管这叫「下一代巨模型失望陷阱」:堆数据堆算力换能力跃升的老路,收益肉眼可见地递减,发布会越开越像挤牙膏。


对模型公司,这是坏消息。


但对芯片设计师,这是好事儿。正因为架构不再月月大改,「把骨架焊死」才第一次从疯狂变成可行。


几年前,把“模型骨架五年不变”写进芯片,几乎等于押注技术停止进化。


今天这仍是一场豪赌,只是Google判断,赔率已经变了:模型能力会继续迭代,但底层计算形态未必还会频繁翻修。


Google被曝正在研发一颗新的服务器AI芯片,把Gemini固化到硬件里


而3.5的难产,恰恰给这个判断做了注脚。连Google自己,都很难再让模型发生「长相级」的变化了。


当然,赌就是赌。万一范式转移真来了——全新的注意力结构、新的记忆机制、甚至非Transformer的形态——Frozen v2的高效率,一夜之间就会变成技术包袱。


Google等于把2028年之后的筹码,现在就押上了桌。


四、硬件彩票,这次反过来抽了


最后把镜头拉远。这事的影响,不止Google一家。


2020年,Sara Hooker写过一篇论文:《The Hardware Lottery》,硬件彩票。


她的观点是,AI历史上胜出的研究方向,往往不是因为思想最好,而是因为恰好适配了当时的硬件。


深度学习本身就是最大的中奖者——神经网络的思想在上世纪就有了,苦等几十年,直到撞上GPU这张彩票才翻了身。


过去,是硬件在开奖,模型来抽签。


现在,这台彩票机被反过来了:芯片,开始只认某一个模型的骨架。


而且不止Google在干——


1.创业公司Etched把Transformer的运算模式固化进芯片,其他架构一概不跑;


Google被曝正在研发一颗新的服务器AI芯片,把Gemini固化到硬件里


2.更极端的Taalas,连模型权重都直接做进硅片,一颗芯片就是一个模型,官网口号干脆叫"The Model is the Computer"。


Google被曝正在研发一颗新的服务器AI芯片,把Gemini固化到硬件里


Google被曝正在研发一颗新的服务器AI芯片,把Gemini固化到硬件里


3.微软Maia、亚马逊Trainium、Meta的MTIA,他们虽然没走这么极端,但方向也都一致,芯片要为自家负载定制,越来越不通用。 


币圈已经把这条路走过一遍。


比特币挖矿从CPU走向GPU,再走向ASIC矿机。专用化每前进一步,效率都会大幅上升,但单颗芯片能做的事情也越来越少。


如果AI芯片也走上这条单行道,真正的问题就来了——


五年后,当全世界的数据中心里插满了只认Transformer、甚至只认Gemini骨架的芯片。


但前沿研究和新架构仍然需要灵活的硬件。


但当更多资金、电力和先进产能被分配给已经验证过的模型路线,新想法拿到第一批算力的成本会越来越高。


五年后,如果全世界的数据中心里插满了优先服务Transformer,甚至只为特定模型优化的芯片。


那个可能颠覆Transformer的新架构,要先跑在什么机器上?


它的「GPU时刻」,又由谁提供?


文章来自于"夕小瑶科技说",作者 "丸美小沐"。

关键词: AI新闻 , 谷歌AI , AI芯片 , Frozen v2
AI转型,免费服务,就找AITNT