輝達計劃打造萬億參數開源AI模型,免費模型撬動GPU需求

Nashnova编辑部
Published todayAbout 4 min read

英偉達正研發萬億參數的開源模型Nemotron 4,不靠模型收費,而是用免費模型拉動GPU全棧銷售——這意味著→ 它正從晶片供應商轉型為AI生態的基礎設施營運商。

01

英偉達為甚麼要親自下場做開源模型?

據The Information報道,英偉達正推進Nemotron 4研發,最大版本預計至少1萬億個總參數,約為今年6月發布的Nemotron 3 Ultra的兩倍。
預訓練數據和架構已有初步方案,但最終規格與發布時間未定,最關鍵的一輪訓練尚未開始
這意味著→ 英偉達的角色正從開源AI生態的「贊助商」變成親自下場的「建設者」——模型本身免費,錢從GPU和整套基礎設施上賺。
02

為甚麼要把客戶「攤開」?

英偉達GPU需求高度集中:最新季報顯示,前三大客戶合計貢獻當季收入的54%,分別佔21%、17%和16%
同時,大客戶正加速自研晶片:亞馬遜AWS的Trainium 2已承接Anthropic訓練與推理,谷歌Ironwood TPU面向大規模訓練,AMD以MI350和ROCm爭奪開放模型負載。
簡單來說= 閉源模型把需求鎖在少數大客戶手裡,這些客戶不僅議價能力強,還有動力把成熟工作遷到自研晶片上。英偉達最想要的局面是成千上萬個不同的模型同時跑——需求越分散,定製晶片越難通吃,通用GPU和CUDA生態的護城河越深。
03

免費模型怎樣變成一條收入鏈?

英偉達已鋪好完整路徑:開放Nemotron提供模型權重和訓練配方 → 企業用NeMo微調和評測 → 部署接入NIM推理微服務和TensorRT-LLM → 規模擴大後,算力落到DGX Cloud、公有雲GPU或自建集群,NVLink網絡和NVIDIA AI Enterprise訂閱隨之進入賬單。
已有早期樣板:Palantir將Nemotron引入美國政府隔離網絡,客戶在本地訓練並保留權重;日本市場則是「主權AI」模板——研究機構用Nemotron數據訓練日語模型,私有基礎設施由HGX B300承擔,邊緣部署由Jetson負責。
這意味著→ 模型免費只是入口,英偉達真正賣的是從訓練到部署的全棧基礎設施
04

「越便宜反而花越多」的邏輯是甚麼?

英偉達同期發布了免費的模型路由軟件:簡單任務交給小模型、困難任務交給大模型,表面上降低單次算力成本。
這反映出一個反直覺的押注——單次成本下降後,企業會啟動更多常駐智能體(agent),把一次問答擴展為包含規劃、搜索、工具調用和驗證的連續流程,推理總支出反而上升
Gartner預計,到2030年萬億參數模型推理成本將比2025年下降90%以上,但智能體每項任務消耗的token可能是普通聊天機器人的5至30倍
05

萬億參數夠不夠用?

現有Nemotron 3 Ultra擁有5500億個總參數、每個token激活550億參數,支持最長100萬token上下文。英偉達公布的推理吞吐量明顯更高。
但據The Information援引第三方榜單,它仍落後於最強的中國開放模型,在全球綜合模型中也遠非第一梯隊
簡單來說= 稀疏MoE架構(一種「不是所有參數每次都上陣」的設計)裡,參數總量不等於實際能力——數據質量、訓練規模和工具調用能力共同決定最終效果。萬億參數的Nemotron 4若進不了真實任務的第一梯隊,就很難改變企業採購決策。這是整個戰略能否成立的關鍵驗證點。

Content is for reference only, not financial advice.

輝達計劃打造萬億參數開源AI模型,免費模型撬動GPU需求 · nashnova