英伟达Vera Rubin服务器安装难度低于前代
Miles Bennett
多家云厂商高管称英伟达新一代Vera Rubin机架初步测试中安装难度明显低于上一代Grace Blackwell,但售价翻倍、功耗升75%,且更强的Ultra版本明年才是真正考验。
安装为什么比上一代容易了?
云厂商高管称Vera Rubin机架每台仍配72个GPU + 36个CPU,与Grace Blackwell配置高度相似。这意味着→ 硬件结构没有大改,安装团队不需要重新学一套流程。
一位高管直言:"从机械和散热角度看,这已经是第三代产品了。"用大白话说= 前两代踩过的坑,这一代都绕开了。
英伟达称新系统与现有Grace Blackwell软件高度兼容,但两位云厂商高管指出,软件适配到大规模集群仍需数月时间。
价格翻倍,凭什么说值?
Vera Rubin机架售价至少是初代Grace Blackwell的两倍,但英伟达给出的数据是:AI算力效率(每秒每瓦AI token数)提升了10倍。这意味着→ 单位算力的性价比反而大幅改善,花两倍的钱买到十倍的效率。
功耗方面,每台机架比前代高出75%,运行温度也更高。新冷却系统理论上更节能,但安装难度更大。
GPU云服务商Vultr首席营销官科克伦表示,数据中心必须从零建设全新基础设施来容纳Vera Rubin——改造旧数据中心成本过高。
散热问题拖了多久的后腿?
一位密切跟踪英伟达股票的分析师透露,散热工程问题导致首批Vera Rubin服务器生产推迟了约两个月。
英伟达发言人对此回应称"与我们此前公布的内容相比没有任何变化"。用大白话说= 官方既没承认也没否认,只是重复了原来的口径。
网络故障排查为什么被称为"黑魔法"?
黄仁勋在今年3月开发者大会上展示连接Rubin GPU的新型网络交换机时说:"这极其难以做好,极其难以实现,句号。"
一位负责大型计算集群的甲骨文员工称,在此类集群中定位网络故障"极其困难",需要"黑魔法"般的技巧。这反映出 硬件安装变简单了,但大规模集群的网络调试仍然是最难啃的骨头。
Rubin机架拥有130万个零部件,略多于初代Blackwell的120万个,部分组件属于全新设计。
Ultra版本才是真正的考验?
目前客户测试的Vera Rubin机架并非最终形态。英伟达计划明年下半年推出更强大的Ultra版本。
Ultra版本将把144个乃至576个GPU互联,并采用垂直插槽设计(类似书架式)取代现有水平设计。这意味着→ 整个机架的物理结构要大改,当前阶段积累的安装经验未必能直接复用。
当前测试顺利,但能否延续至明年数百乃至数千台大规模交付,以及Ultra版本能否如期量产,才是检验这一代产品落地能力的关键。
Content is for reference only, not financial advice.