英伟达GB200能效三个月提升4倍,GB300训练纪录持续刷新

Claire Weston
Published todayAbout 5 min read

英伟达仅用三个月将GB200 NVL72的每兆瓦算力吞吐量提升4倍,同期GB300训练性能创全球新高——已部署客户无需换硬件,软件升级即可大幅降低运营成本。

01

GB200能效三个月翻四倍,怎么做到的?

在运行DeepSeek R1 0528模型时,GB200 NVL72的每兆瓦算力吞吐量(TPS/MW)三个月内提升4倍
这意味着→ 已经买了Blackwell机柜的客户,不用换硬件,刷一次软件就能把同样一度电的产出翻两番。
背后是四个月内完成的38项重大优化,从超过25万种模拟配置中筛选,再用140万GPU小时实测验证。
用大白话说= 英伟达把"调参"做成了一套工业级流水线——海量模拟先缩小范围,再用真机逐一跑通。
02

这些优化只适用于一个模型吗?

英伟达明确表示,超过90%的优化成果可跨模型复用,适用于整个AI产品组合。
这意味着→ 这不是针对DeepSeek的"应试调优",而是底层通用改进——换一个模型,大部分收益仍在。
这反映出英伟达的优化策略正从"单模型冲榜"转向平台级能效提升,锁定的是长期客户黏性。
03

GB300训练性能提升了多少?

GB300 NVL72在256卡规模下,对DeepSeek-V3 671B模型预训练达到每GPU 1648 TFLOPs,是GB200的606 TFLOPs的约3倍,创全球最高纪录。
这个数字还在涨:从2025年11月的1088 TFLOPs/GPU到2026年6月的1648 TFLOPs/GPU,六个月累计提升约1.5倍
用大白话说= 同一块GPU,半年前能算的量,现在能算一倍半——全靠软件和框架层面的持续挤压。
04

不同训练框架的表现差异有多大?

Megatron Core框架(英伟达自家训练栈)表现最强,1648 TFLOPs/GPU
TorchTitan(PyTorch原生训练栈)从未优化基线的199 TFLOPs/GPU跃升至1197 TFLOPs/GPU,提升6倍
JAX框架提升最猛:每GPU吞吐量从2026年1月的418 Tokens/s升至7月的4082 Tokens/s,约10倍
这意味着→ 无论客户用哪套主流框架,英伟达都在同步做深度适配,不存在"只有自家栈才快"的锁定
05

扩展到上千张卡后,效率会不会大打折扣?

256卡扩展到1024卡,三大框架效率均接近理论上限:Megatron Core 98.5%,TorchTitan与JAX均为97%
英伟达将此归因于NVL72机架内置的800 Gb/s Scale-Out网络芯片(机架之间高速传数据的专用芯片)。
用大白话说= 卡越多,卡与卡之间的"交通"越容易堵;英伟达靠内置高速网络把这条路修得足够宽,堵车损耗压到不足3%
06

下一代Vera Rubin来了,Blackwell会被抛弃吗?

Vera Rubin NVL72的Token吞吐量较Blackwell提升约10倍:GB200约80,000 Tokens/s,Vera Rubin在同等150MW功耗下可达800,000 Tokens/s
但英伟达的策略与Hopper世代一致:新平台推进与旧平台软件优化双线并行
这意味着→ 买了Blackwell的客户不会被"遗弃"——英伟达靠持续软件升级延长已部署硬件的生命周期,这是平台黏性的核心逻辑
这反映出英伟达真正卖的不只是芯片,而是一套"硬件+持续优化"的订阅式算力服务。

Content is for reference only, not financial advice.

英伟达GB200能效三个月提升4倍,GB300训练纪录持续刷新 · nashnova