谷歌TPU Ironwood每美元性能最高领先英伟达B200达50%

nashnova research
今天发布阅读约 4 分钟

SemiAnalysis首份第三方推理测试显示,谷歌TPUv7 Ironwood在每美元性能上最高领先英伟达B200达50%、B300达96%,AI推理芯片的性价比格局正被改写。

01

便宜多少?数字怎么看?

以Qwen3.5 397B模型为基准,每百万token推理成本Ironwood约0.181美元,B200为0.222美元,B300为0.276美元——分别便宜约19%和34%
这意味着→ 跑同样的大模型推理任务,换成谷歌芯片,账单直接打八折甚至七折。
在低并发、高交互场景下优势最大:Ironwood每美元产出的token数比B200高出50.4%,比B300高出96.0%
用大白话说= 用户越少、对话越实时的场景(比如一对一AI助手),Ironwood的性价比碾压最明显。
02

英伟达就没有赢的地方?

在约30秒中位响应时间附近的局部区间,B200仍可反超Ironwood
英伟达GPU支持FP4精度(一种更低精度的计算格式,用更少的数据位换更快的速度),Ironwood目前不支持原生FP4——这意味着→ 在追求极致低精度推理的场景,英伟达仍有技术护城河。
当GB300 NVL72采用分离式服务(把"理解问题"和"生成回答"拆到不同芯片上跑)时,在中等延迟区间有约30%的每美元优势。SemiAnalysis认为TPUv7完成分离式优化后这一差距将消除。
03

软件生态——谷歌最大的短板补上了吗?

长期以来,外部开发者用谷歌TPU最头疼的是软件栈:必须把PyTorch模型先转译成JAX框架才能跑,过程繁琐、兼容性差。
新方案TorchTPU让开发者直接用`.to("tpu")`一行代码把模型搬到TPU上,不再需要跨框架重写,vLLM、SGLang等主流推理引擎可以复用大量现有代码。
TorchTPU目前仍在私有测试,预计10月PyTorch大会期间开源。这意味着→ 真正的生态验证要等开源后,看它能否进入主流推理引擎的"Day 0"支持名单。
04

硬件上Ironwood到底强在哪?

单颗芯片集成两个独立计算裸片,矩阵乘法单元采用256×256脉动阵列(一种让大量计算单元像流水线一样协同工作的结构),每周期运算量是上一代的4倍
HBM内存容量约为上一代Trillium的6倍,首次支持原生FP8硬件加速。
通过光学电路交换机可扩展至9,216颗芯片的超级Pod,总算力达42.5 FP8 exaflops
内核优化方面,优化KV缓存页面布局后吞吐量提升16.5%,中位首token时延下降95%
05

谁在买单?市场格局怎么变?

Anthropic已承诺采购逾百万颗TPU,成为谷歌TPU最大外部客户,预计到2029年其用量将超过DeepMind自身。
这反映出 谷歌TPU正从"自家用的内部芯片"变成"对外卖的商业产品",开始直接抢英伟达的客户。
谷歌第八代TPU首次将训练与推理拆成两款独立芯片:TPU 8t面向训练,TPU 8i(代号Boardfly)面向推理。SemiAnalysis认为TPU 8i有望与英伟达下一代Rubin NVL72正面竞争。
用大白话说= 谷歌不再只是英伟达的客户,而是正式成为它的对手——能不能真正撼动格局,关键看软件生态能否跟上。

市场有风险,内容仅供研究参考,不构成投资建议。

谷歌TPU Ironwood每美元性能最高领先英伟达B200达50% · nashnova