瑞银调研:开源模型Token份额急升,推理算力全面告急

Taylor Wilson
Published todayAbout 5 min read

瑞银调研显示企业级开源模型Token占比半年内从0.1%飙升至10%以上,但推理算力供给已全面紧缺——Kimi 3上线48小时即触及算力上限,Databricks多区域GPU告罄。

01

开源模型Token份额半年翻了100倍,钱去哪了?

某AI企业披露:今年1月开源模型仅占企业总Token量0.1%,两个月后升至1%,目前已远超10%;该机构预测12个月内将突破90%
这意味着→ 企业用开源模型跑的任务量正以指数级增长,但这不等于开源赚到了钱——90%以上算力支出仍投向闭源前沿模型
用大白话说= 开源模型抢走了"跑量"的活,但高价值、高难度的核心业务场景,客户仍愿意为闭源模型付高价。头部模型厂商在这类场景中依然握有定价权
第三方佐证:Together AI数据显示开源Token消耗占比一年内从10%升至30%;开源模型性能落后闭源头部约90天,但运行成本仅为后者的10%至30%
02

企业AI账单涨了多少?为什么有人不在乎?

瑞银测算约60%企业将AI算力成本列为核心痛点。实例:某金融机构Claude采购订单3个月内从1000万美元增至6000万美元;某银行每月在Opus 4.8推理上花费数十万美元,其中大量是低复杂度查询。
一家AI原生企业对Anthropic的月度支出从去年12月的2万美元飙升至今年7月近100万美元——但公司营收增速更快,应对方式是设用量上限,而非缩减部署。
这意味着→ 成本暴涨并不必然触发降本——当AI带来的收入增长跑赢支出增长时,企业选择控量而非砍单
AI智能体(让AI自动完成多步骤任务的程序)的循环重试机制会将单次流程Token消耗放大10至100倍。某客户单部门Claude支出甚至超过该部门全员薪酬,同时仍在持续扩招。
03

按量计费时代来了,谁最先感到痛?

微软6月1日起将GitHub Copilot(AI编程助手)全面改为按Token计费,参会企业普遍认为这加速了成本优化诉求。
但约60%客户初次选定模型后长期不更换。这反映出企业在模型切换上存在明显惯性——换模型的迁移成本和验证周期让多数客户选择"不动"。
算力调度路由平台(自动为不同任务匹配最优模型的中间层)通过调度结合部分迁移至自研低价模型,平均可为客户节省20%至30%算力开支。
这意味着→ 在按量计费的新规则下,"帮客户省钱"本身就是一门好生意,算力调度类产品的价值空间被打开。
04

推理算力到底有多紧缺?

月之暗面旗下Kimi 3上线48小时即触及算力上限,已暂停新用户订阅。同时托管Kimi及多款开源模型的Databricks多区域GPU全面紧缺,本轮融资核心目的就是买GPU。
Fireworks最新营收突破10亿美元(今年1月仅4亿),日处理超40万亿Token,同步完成10亿美元融资,投后估值175亿美元;Baseten日处理30万亿Token,管理层称流量或已超过OpenAI官方API。
闭源头部方面,Anthropic与谷歌近期已从SpaceX锁定额外算力。瑞银供应链调研显示,未来数年OpenAI、Anthropic还将新增数十万GW级算力储备
用大白话说= 不管开源还是闭源,大家都在抢GPU。推理侧的算力缺口已经从"可能出现"变成"正在发生"。
05

英伟达Nemotron为何突然被热议?开源落地还差什么?

英伟达Nemotron是本次峰会提及频次最高的美国本土开源模型,半年前几乎无人讨论。这反映出2025年12月Nemotron 3正式发布后,英伟达在开源生态中的存在感快速上升。
但开源落地仍有硬约束:某服务商披露平台80%算力流量依旧走Claude;所有金融、政务等强监管行业客户均拒绝部署特定大模型
这意味着→ 开源模型在Token用量上的份额暴涨,并不意味着它在高价值场景中被信任。监管合规和模型可靠性仍是闭源的护城河。
算力供给能否跟上Token消耗的指数级增长,将决定上述推理平台估值能否持续兑现——这是当前AI基础设施赛道最核心的悬念。

Content is for reference only, not financial advice.

瑞银调研:开源模型Token份额急升,推理算力全面告急 · nashnova