谷歌TPU Ironwood每美元性能最高領先輝達B200達50%
nashnova research
SemiAnalysis首份第三方推理測試顯示,谷歌TPUv7 Ironwood每美元性能最高領先英偉達B200達50%、B300達96%,AI推理晶片的性價比格局正被改寫。
平多少?數字點睇?
以Qwen3.5 397B模型為基準,每百萬token推理成本Ironwood約0.181美元,B200為0.222美元,B300為0.276美元——分別便宜約19%和34%。
這意味著→ 跑同一個大模型推理任務,換成谷歌晶片,賬單直接打八折甚至七折。
在低並發、高互動場景下優勢最大:Ironwood每美元產出的token數比B200高出50.4%,比B300高出96.0%。
簡單來說= 用戶越少、對話越即時的場景(例如一對一AI助手),Ironwood的性價比輾壓最明顯。
英偉達就冇贏的地方?
在約30秒中位回應時間附近的局部區間,B200仍可反超Ironwood。
英偉達GPU支援FP4精度(一種更低精度的計算格式,用更少數據位換更快速度),Ironwood目前不支援原生FP4——這意味著→ 在追求極致低精度推理的場景,英偉達仍有技術護城河。
當GB300 NVL72採用分離式服務(將「理解問題」和「生成回答」拆到不同晶片上跑)時,在中等延遲區間有約30%的每美元優勢。SemiAnalysis認為TPUv7完成分離式優化後這一差距將消除。
軟件生態——谷歌最大的短板補上了嗎?
長期以來,外部開發者用谷歌TPU最頭痛的是軟件棧:必須將PyTorch模型先轉譯成JAX框架才能跑,過程繁瑣、兼容性差。
新方案TorchTPU讓開發者直接用`.to("tpu")`一行代碼將模型搬到TPU上,毋須跨框架重寫,vLLM、SGLang等主流推理引擎可以複用大量現有代碼。
TorchTPU目前仍在私有測試,預計10月PyTorch大會期間開源。這意味著→ 真正的生態驗證要等開源後,看它能否進入主流推理引擎的「Day 0」支援名單。
硬件上Ironwood到底強在邊度?
單顆晶片集成兩個獨立計算裸片,矩陣乘法單元採用256×256脈動陣列(一種令大量計算單元像流水線般協同運作的結構),每週期運算量是上一代的4倍。
HBM記憶體容量約為上一代Trillium的6倍,首次支援原生FP8硬件加速。
透過光學電路交換機可擴展至9,216顆晶片的超級Pod,總算力達42.5 FP8 exaflops。
內核優化方面,優化KV緩存頁面佈局後吞吐量提升16.5%,中位首token時延下降95%。
邊個買單?市場格局點變?
Anthropic已承諾採購逾百萬顆TPU,成為谷歌TPU最大外部客戶,預計到2029年其用量將超過DeepMind自身。
這反映出 谷歌TPU正從「自家用的內部晶片」變成「對外賣的商業產品」,開始直接搶英偉達的客戶。
谷歌第八代TPU首次將訓練與推理拆成兩款獨立晶片:TPU 8t面向訓練,TPU 8i(代號Boardfly)面向推理。SemiAnalysis認為TPU 8i有望與英偉達下一代Rubin NVL72正面競爭。
簡單來說= 谷歌不再只是英偉達的客戶,而是正式成為對手——能否真正撼動格局,關鍵睇軟件生態能否跟上。
市场有风险,内容仅供研究参考,不构成投资建议。