輝達Vera Rubin伺服器安裝難度低於前代
Miles Bennett
多家雲端廠商高管稱英偉達新一代Vera Rubin機架初步測試中安裝難度明顯低於上一代Grace Blackwell,但售價翻倍、功耗升75%,而更強的Ultra版本明年才是真正考驗。
安裝為甚麼比上一代容易了?
雲端廠商高管表示,Vera Rubin機架每台仍配72個GPU + 36個CPU,與Grace Blackwell配置高度相似。這意味著→ 硬件結構沒有大改,安裝團隊毋須重新學一套流程。
一位高管直言:「從機械和散熱角度看,這已經是第三代產品了。」簡單來說= 前兩代踩過的坑,這一代都避開了。
英偉達稱新系統與現有Grace Blackwell軟件高度兼容,但兩位雲端廠商高管指出,軟件適配至大規模集群仍需數月時間。
價錢翻倍,憑甚麼說值?
Vera Rubin機架售價至少是初代Grace Blackwell的兩倍,但英偉達給出的數據是:AI算力效率(每秒每瓦AI token數)提升了10倍。這意味著→ 單位算力的性價比反而大幅改善,花兩倍的錢買到十倍的效率。
功耗方面,每台機架比前代高出75%,運行溫度也更高。新冷卻系統理論上更節能,但安裝難度更大。
GPU雲端服務商Vultr首席營銷官科克倫表示,數據中心必須從零建設全新基礎設施來容納Vera Rubin——改造舊數據中心成本過高。
散熱問題拖了多久的後腿?
一位密切跟蹤英偉達股票的分析師透露,散熱工程問題導致首批Vera Rubin伺服器生產推遲了約兩個月。
英偉達發言人對此回應稱「與我們此前公佈的內容相比沒有任何變化」。簡單來說= 官方既沒承認也沒否認,只是重複了原來的口徑。
網絡故障排查為甚麼被稱為「黑魔法」?
黃仁勳在今年3月開發者大會上展示連接Rubin GPU的新型網絡交換機時說:「這極其難以做好,極其難以實現,句號。」
一位負責大型計算集群的甲骨文員工稱,在此類集群中定位網絡故障「極其困難」,需要「黑魔法」般的技巧。這反映出 硬件安裝變簡單了,但大規模集群的網絡調試仍然是最難啃的骨頭。
Rubin機架擁有130萬個零部件,略多於初代Blackwell的120萬個,部分組件屬於全新設計。
Ultra版本才是真正的考驗?
目前客戶測試的Vera Rubin機架並非最終形態。英偉達計劃明年下半年推出更強大的Ultra版本。
Ultra版本將把144個乃至576個GPU互聯,並採用垂直插槽設計(類似書架式)取代現有水平設計。這意味著→ 整個機架的物理結構要大改,當前階段積累的安裝經驗未必能直接複用。
當前測試順利,但能否延續至明年數百乃至數千台大規模交付,以及Ultra版本能否如期量產,才是檢驗這一代產品落地能力的關鍵。
Content is for reference only, not financial advice.