英伟达重启Rubin CPX推理芯片,瞄准长上下文预填充成本

nashnova research
今天发布阅读约 3 分钟

英伟达重启此前被市场视为搁置的Rubin CPX芯片项目,专攻AI推理中预填充阶段的降本,郭明錤预计2027年Q1量产——这意味着英伟达正式将推理成本拆解为独立硬件赛道。

01

为什么英伟达要单独做一颗"预填充专用芯片"?

随着大模型上下文越来越长,推理过程中超过50%的算力消耗来自预填充(prefill,把用户输入的所有文字一次性"读完"并生成缓存的阶段)。
这意味着→ 预填充已经不是推理的"准备动作",而是占据一半以上成本的主战场
用大白话说= 你跟AI对话时,它"读你的问题"比"写回答"还贵——英伟达决定专门造一颗芯片来压低"读"的成本。
02

新版CPX的核心规格变了什么?

算力接近标准Rubin GPU,单卡最高功耗同为2300瓦;但显存从此前方案的128GB GDDR7升级为168GB HBM4,仍低于标准Rubin的288GB HBM4。
8卡计算托盘合计约1.34TB显存,足以覆盖大多数长上下文的预填充和KV Cache(模型"读"完输入后生成的临时缓存)需求。
这反映出 CPX的设计思路不是堆通用算力,而是在显存容量和预填充效率之间找最优性价比点
03

机架架构为什么从"共享"改成"独立"?

旧方案中CPX与Rubin GPU共享机架;新版改用独立的MGX ETL机架,客户可单独扩展CPX算力。
部署规模可选64、128、192或256张CPX GPU,每64张为一个机架模块(8个计算托盘 × 8张GPU + 1个交换机托盘)。
用大白话说= 以前买CPX必须"捆绑"买整套大机架,现在可以像搭积木一样按需加购——采购门槛大幅降低。
04

互联带宽为什么刻意"降规格"?

托盘内部8张CPX通过NVLink互联,单卡带宽1–1.5TB/s,仅为标准Rubin GPU的3.6TB/s的约40%。
托盘之间用Spectrum-6以太网全铜链路,跨机架则走OSFP光纤链路——分层设计,逐级降速。
这意味着→ CPX不追求全链路高带宽,而是把互联成本压到预填充场景刚好够用的水平,进一步拉低整体性价比。
05

CPX和标准Rubin GPU怎么配合工作?

英伟达推荐CPX与Vera Rubin NVL72按1:1比例部署:CPX负责预填充并生成KV Cache,再通过以太网RDMA传给Rubin GPU完成解码("写回答")。
用大白话说= CPX是"读题专员",Rubin GPU是"答题专员",各干各的活,整体成本比一颗芯片全干要低。
郭明錤将其定位为"长上下文预填充的最佳性价比方案"——但能否兑现降本承诺,要看2027年量产后的实际表现。

市场有风险,内容仅供研究参考,不构成投资建议。

英伟达重启Rubin CPX推理芯片,瞄准长上下文预填充成本 · nashnova