谷歌研發推理專用晶片,效率或達TPU的10倍

0xBroomberg
Published 2026-07-20About 4 min read

谷歌正開發代號「Frozen v2」的推理專用晶片,將Gemini模型的部分決策邏輯直接固化進矽片,每瓦token處理量預計達現有TPU的6至10倍——這意味著谷歌正試圖用「晶片綁定模型」的激進路線,緩解日益嚴峻的AI算力瓶頸。

01

甚麼是Frozen v2,它和TPU有甚麼本質區別?

Frozen v2的核心思路:把Gemini模型的部分決策邏輯直接刻進晶片,減少運行時的計算步驟和數據搬運量。這意味著→ 晶片不再是「通用計算器」,而是一台只為Gemini定制的「專用機」。
TPU和英偉達GPU屬於通用型AI晶片,可以跑各種模型;Frozen v2則只能跑與設計時相同底層架構的Gemini後續版本。簡單來說= TPU像一個甚麼菜都能炒的灶,Frozen v2像一台只做一道菜、但做得極快的專用機器。
效率的代價是靈活性:一旦Gemini的底層架構發生根本性變化,這顆晶片就可能作廢
02

效率提升6到10倍,這個數字意味著甚麼?

據參與項目的谷歌員工測算,Frozen v2在每單位功耗可處理的token數量上,比最新一代TPU高出6至10倍
這意味著→ 同樣的電力和散熱條件下,推理吞吐量可以翻數倍——對谷歌而言,這直接關係到能用多少算力服務多少用戶。
谷歌計劃最早2028年部署該晶片,但效率優勢能否在實際大規模部署中兌現,仍有待驗證。
03

谷歌為甚麼要走這條激進路線?

背景是谷歌當前面臨嚴峻的AI算力短缺,內部矛盾已經顯現——谷歌雲甚至被迫拒絕部分外部客戶的合作請求
Frozen v2的前身由DeepMind首席科學家杰夫·迪恩(Jeff Dean)主導,初代方案是把模型權重直接燒進晶片,但因晶片被鎖死在特定版本、生命周期過短而擱置。
Frozen v2在此基礎上保留了一定靈活性——谷歌仍可對晶片更新,包括加載新的模型權重。簡單來說= 從「完全焊死」退了一步,變成「半定制、可微調」。
04

產量和定位上,谷歌怎麼規劃?

谷歌明確表示,Frozen v2的產量規劃遠低於TPU,屬於更聚焦的專用部署,不是TPU的替代品。
目前谷歌尚未決定在晶片上固化多少模型信息——這意味著→ 「效率vs.靈活性」的平衡點還沒敲定,最終產品形態仍有變數。
谷歌發言人稱「並非每個項目都會進入量產,但這種嚴格探索是我們全棧方法的核心」——這反映出公司對該項目仍持探索而非承諾的態度。
05

推理晶片賽道,還有誰在做類似的事?

AI推理專用晶片賽道競爭正在全面提速:SambaNova、d-Matrix等初創公司,以及OpenAI、微軟等巨頭均在佈局,目標都是以比英偉達GPU更低的成本跑推理。
英偉達自身也在補短板——去年12月斥資200億美元授權收購推理晶片初創公司Groq的技術。
與Frozen v2思路最接近的是加拿大初創公司Taalas,同樣將特定AI模型硬連線進晶片,已融資逾2億美元。這反映出「晶片綁定模型」並非谷歌獨家思路,而是行業正在驗證的一條技術路徑。

Content is for reference only, not financial advice.