英伟达计划打造万亿参数开源AI模型,免费模型撬动GPU需求

Nashnova编辑部
Published todayAbout 4 min read

英伟达正研发万亿参数的开源模型Nemotron 4,不靠模型收费,而是用免费模型拉动GPU全栈销售——这意味着→ 它正从芯片供应商转型为AI生态的基础设施运营商。

01

英伟达为什么要亲自下场做开源模型?

据The Information报道,英伟达正推进Nemotron 4研发,最大版本预计至少1万亿个总参数,约为今年6月发布的Nemotron 3 Ultra的两倍。
预训练数据和架构已有初步方案,但最终规格与发布时间未定,最关键的一轮训练尚未开始
这意味着→ 英伟达的角色正从开源AI生态的"赞助商"变成亲自下场的"建设者"——模型本身免费,钱从GPU和整套基础设施上赚。
02

为什么要把客户"摊开"?

英伟达GPU需求高度集中:最新季报显示,前三大客户合计贡献当季收入的54%,分别占21%、17%和16%
与此同时,大客户在加速自研芯片:亚马逊AWS的Trainium 2已承接Anthropic训练与推理,谷歌Ironwood TPU面向大规模训练,AMD以MI350和ROCm争夺开放模型负载。
用大白话说= 闭源模型把需求锁在少数大客户手里,这些客户不仅议价能力强,还有动力把成熟工作迁到自研芯片上。英伟达最想要的局面是成千上万个不同的模型同时跑——需求越分散,定制芯片越难通吃,通用GPU和CUDA生态的护城河越深。
03

免费模型怎么变成一条收入链?

英伟达已铺好完整路径:开放Nemotron提供模型权重和训练配方 → 企业用NeMo微调和评测 → 部署接入NIM推理微服务和TensorRT-LLM → 规模扩大后,算力落到DGX Cloud、公有云GPU或自建集群,NVLink网络和NVIDIA AI Enterprise订阅随之进入账单。
已有早期样板:Palantir将Nemotron引入美国政府隔离网络,客户在本地训练并保留权重;日本市场则是"主权AI"模板——研究机构用Nemotron数据训练日语模型,私有基础设施由HGX B300承担,边缘部署由Jetson负责。
这意味着→ 模型免费只是入口,英伟达真正卖的是从训练到部署的全栈基础设施
04

"越便宜反而花越多"的逻辑是什么?

英伟达同期发布了免费的模型路由软件:简单任务交给小模型、困难任务交给大模型,表面上降低单次算力成本。
这反映出一个反直觉的押注——单次成本下降后,企业会启动更多常驻智能体(agent),把一次问答扩展为包含规划、搜索、工具调用和验证的连续流程,推理总支出反而上升
Gartner预计,到2030年万亿参数模型推理成本将比2025年下降90%以上,但智能体每项任务消耗的token可能是普通聊天机器人的5至30倍
05

万亿参数够不够用?

现有Nemotron 3 Ultra拥有5500亿个总参数、每个token激活550亿参数,支持最长100万token上下文。英伟达公布的推理吞吐量明显更高。
但据The Information援引第三方榜单,它仍落后于最强的中国开放模型,在全球综合模型中也远非第一梯队
用大白话说= 稀疏MoE架构(一种"不是所有参数每次都上阵"的设计)里,参数总量不等于实际能力——数据质量、训练规模和工具调用能力共同决定最终效果。万亿参数的Nemotron 4若进不了真实任务的第一梯队,就很难改变企业采购决策。这是整个战略能否成立的关键验证点。

Content is for reference only, not financial advice.

英伟达计划打造万亿参数开源AI模型,免费模型撬动GPU需求 · nashnova