輝達GB200能效三個月提升4倍,GB300訓練紀錄持續刷新

Claire Weston
Published todayAbout 5 min read

英偉達僅用三個月將GB200 NVL72的每兆瓦算力吞吐量提升4倍,同期GB300訓練性能創全球新高——已部署客戶毋須換硬件,軟件升級即可大幅削減營運成本。

01

GB200能效三個月翻四倍,怎樣做到?

運行DeepSeek R1 0528模型時,GB200 NVL72的每兆瓦算力吞吐量(TPS/MW)三個月內提升4倍
這意味著→ 已購入Blackwell機櫃的客戶,毋須更換硬件,刷一次軟件便能將同一度電的產出翻兩番。
背後是四個月內完成的38項重大優化,從逾25萬種模擬配置中篩選,再以140萬GPU小時實測驗證。
簡單來說= 英偉達將「調參」做成了工業級流水線——海量模擬先收窄範圍,再用真機逐一跑通。
02

這些優化只適用於單一模型嗎?

英偉達明確表示,逾90%的優化成果可跨模型複用,適用於整個AI產品組合。
這意味著→ 這並非針對DeepSeek的「應試調優」,而是底層通用改進——換一個模型,大部分收益仍在。
這反映出英偉達的優化策略正從「單模型衝榜」轉向平台級能效提升,鎖定的是長期客戶黏性。
03

GB300訓練性能提升了多少?

GB300 NVL72在256卡規模下,對DeepSeek-V3 671B模型預訓練達到每GPU 1648 TFLOPs,為GB200的606 TFLOPs的約3倍,創全球最高紀錄。
這個數字仍在增長:從2025年11月的1088 TFLOPs/GPU升至2026年6月的1648 TFLOPs/GPU,六個月累計提升約1.5倍
簡單來說= 同一塊GPU,半年前能算的量,現在能算一倍半——全靠軟件和框架層面的持續擠壓。
04

不同訓練框架的表現差異有多大?

Megatron Core框架(英偉達自家訓練棧)表現最強,1648 TFLOPs/GPU
TorchTitan(PyTorch原生訓練棧)從未優化基線的199 TFLOPs/GPU躍升至1197 TFLOPs/GPU,提升6倍
JAX框架提升最猛:每GPU吞吐量從2026年1月的418 Tokens/s升至7月的4082 Tokens/s,約10倍
這意味著→ 無論客戶用哪套主流框架,英偉達都在同步做深度適配,不存在「只有自家棧才快」的鎖定
05

擴展到過千張卡後,效率會否大打折扣?

256卡擴展到1024卡,三大框架效率均接近理論上限:Megatron Core 98.5%,TorchTitan與JAX均為97%
英偉達將此歸因於NVL72機架內置的800 Gb/s Scale-Out網絡晶片(機架之間高速傳輸數據的專用晶片)。
簡單來說= 卡越多,卡與卡之間的「交通」越容易擠塞;英偉達靠內置高速網絡將這條路修得足夠闊,塞車損耗壓到不足3%
06

下一代Vera Rubin來了,Blackwell會被棄用嗎?

Vera Rubin NVL72的Token吞吐量較Blackwell提升約10倍:GB200約80,000 Tokens/s,Vera Rubin在同等150MW功耗下可達800,000 Tokens/s
但英偉達的策略與Hopper世代一致:新平台推進與舊平台軟件優化雙線並行
這意味著→ 買了Blackwell的客戶不會被「遺棄」——英偉達靠持續軟件升級延長已部署硬件的生命週期,這是平台黏性的核心邏輯
這反映出英偉達真正賣的不只是晶片,而是一套「硬件+持續優化」的訂閱式算力服務。

Content is for reference only, not financial advice.

輝達GB200能效三個月提升4倍,GB300訓練紀錄持續刷新 · nashnova