谷歌研发推理专用芯片,效率或达TPU的10倍

0xBroomberg
Published 2026-07-20About 4 min read

谷歌正在开发代号「Frozen v2」的推理专用芯片,将Gemini模型的部分决策逻辑直接固化进硅片,每瓦token处理量预计达现有TPU的6至10倍——这意味着谷歌正试图用「芯片绑定模型」的激进路线,缓解日益严峻的AI算力瓶颈。

01

什么是Frozen v2,它和TPU有什么本质区别?

Frozen v2的核心思路:把Gemini模型的部分决策逻辑直接刻进芯片,减少运行时的计算步骤和数据搬运量。这意味着→ 芯片不再是「通用计算器」,而是一台只为Gemini定制的「专用机」。
TPU和英伟达GPU属于通用型AI芯片,可以跑各种模型;Frozen v2则只能跑与设计时相同底层架构的Gemini后续版本。用大白话说= TPU像一台什么菜都能炒的灶,Frozen v2像一台只做一道菜、但做得极快的专用机器。
效率代价是灵活性:一旦Gemini的底层架构发生根本性变化,这颗芯片就可能作废
02

效率提升6到10倍,这个数字意味着什么?

据参与项目的谷歌员工测算,Frozen v2在每单位功耗可处理的token数量上,比最新一代TPU高出6至10倍
这意味着→ 同样的电力和散热条件下,推理吞吐量可以翻数倍——对谷歌来说,这直接关系到能用多少算力服务多少用户。
谷歌计划最早2028年部署该芯片,但效率优势能否在实际大规模部署中兑现,仍有待验证。
03

谷歌为什么要走这条激进路线?

背景是谷歌当前面临严峻的AI算力短缺,内部矛盾已经显现——谷歌云甚至被迫拒绝部分外部客户的合作请求
Frozen v2的前身由DeepMind首席科学家杰夫·迪恩(Jeff Dean)主导,初代方案是把模型权重直接烧进芯片,但因芯片被锁死在特定版本、生命周期过短而搁置。
Frozen v2在此基础上保留了一定灵活性——谷歌仍可对芯片更新,包括加载新的模型权重。用大白话说= 从「完全焊死」退了一步,变成「半定制、可微调」。
04

产量和定位上,谷歌怎么规划?

谷歌明确表示,Frozen v2的产量规划远低于TPU,属于更聚焦的专用部署,不是TPU的替代品。
目前谷歌尚未决定在芯片上固化多少模型信息——这意味着→ 「效率vs.灵活性」的平衡点还没敲定,最终产品形态仍有变数。
谷歌发言人称「并非每个项目都会进入量产,但这种严格探索是我们全栈方法的核心」——这反映出公司对该项目仍持探索而非承诺的态度。
05

推理芯片赛道,还有谁在做类似的事?

AI推理专用芯片赛道竞争正在全面提速:SambaNova、d-Matrix等初创公司,以及OpenAI、微软等巨头均在布局,目标都是以比英伟达GPU更低的成本跑推理。
英伟达自身也在补短板——去年12月斥资200亿美元授权收购推理芯片初创公司Groq的技术。
与Frozen v2思路最接近的是加拿大初创公司Taalas,同样将特定AI模型硬连线进芯片,已融资逾2亿美元。这反映出「芯片绑定模型」并非谷歌独家思路,而是行业正在验证的一条技术路径。

Content is for reference only, not financial advice.