輝達重啟Rubin CPX推理晶片,瞄準長上下文預填充成本
nashnova research
英偉達重啟此前被市場視為擱置的Rubin CPX晶片項目,專攻AI推理中預填充階段的降本,郭明錤預計2027年Q1量產——這意味著英偉達正式將推理成本拆解為獨立硬件賽道。
為甚麼英偉達要單獨做一顆「預填充專用晶片」?
隨著大模型上下文愈來愈長,推理過程中超過50%的算力消耗來自預填充(prefill,將用戶輸入的所有文字一次過「讀完」並生成緩存的階段)。
這意味著→ 預填充已經不是推理的「準備動作」,而是佔據一半以上成本的主戰場。
簡單來說= 你同AI對話時,它「讀你的問題」比「寫回答」還貴——英偉達決定專門造一顆晶片來壓低「讀」的成本。
新版CPX的核心規格變了甚麼?
算力接近標準Rubin GPU,單卡最高功耗同為2,300瓦;但顯存從此前方案的128GB GDDR7升級為168GB HBM4,仍低於標準Rubin的288GB HBM4。
8卡計算托盤合計約1.34TB顯存,足以覆蓋大多數長上下文的預填充及KV Cache(模型「讀」完輸入後生成的臨時緩存)需求。
這反映出 CPX的設計思路並非堆砌通用算力,而是在顯存容量與預填充效率之間找最優性價比。
機架架構為何從「共享」改為「獨立」?
舊方案中CPX與Rubin GPU共享機架;新版改用獨立的MGX ETL機架,客戶可單獨擴展CPX算力。
部署規模可選64、128、192或256張CPX GPU,每64張為一個機架模組(8個計算托盤 × 8張GPU + 1個交換機托盤)。
簡單來說= 以前買CPX必須「捆綁」買整套大機架,現在可以如砌積木般按需加購——採購門檻大幅降低。
互聯頻寬為何刻意「降規格」?
托盤內部8張CPX透過NVLink互聯,單卡頻寬1–1.5TB/s,僅為標準Rubin GPU 3.6TB/s的約40%。
托盤之間用Spectrum-6以太網全銅鏈路,跨機架則走OSFP光纖鏈路——分層設計,逐級降速。
這意味著→ CPX不追求全鏈路高頻寬,而是將互聯成本壓到預填充場景剛好夠用的水平,進一步拉低整體性價比。
CPX和標準Rubin GPU怎樣配合運作?
英偉達建議CPX與Vera Rubin NVL72按1:1比例部署:CPX負責預填充並生成KV Cache,再透過以太網RDMA傳至Rubin GPU完成解碼(「寫回答」)。
簡單來說= CPX是「讀題專員」,Rubin GPU是「答題專員」,各司其職,整體成本比一顆晶片全包要低。
郭明錤將其定位為「長上下文預填充的最佳性價比方案」——但能否兌現降本承諾,要看2027年量產後的實際表現。
市场有风险,内容仅供研究参考,不构成投资建议。