WAIC 2026:中国AI竞争轴转向低成本token生产

Taylor Wilson
Published todayAbout 5 min read

上海世界人工智能大会上,「token工厂」成为核心议题——中国AI产业竞争焦点正从模型参数和芯片数量,转向每个token的推理成本与盈利能力,这意味着行业进入「谁能更便宜地产出智能」的新阶段。

01

为什么突然都在谈"token工厂"?

中国模型即服务市场的企业token消耗量,从2025年1月的日均约1.6万亿个飙升至年底的约9.6万亿个,不到一年翻了近六倍。
这意味着→ 需求已经大到"模型好不好"不再是唯一问题,"跑一次推理花多少钱"成了决定性指标
用大白话说= 以前比谁的模型更大更聪明,现在比谁能用更低成本"生产"出每一个回答。这就是"token工厂"逻辑的起点。
02

商汤的方案:用不同芯片干不同活,怎么做到的?

商汤旗下SenseCore提出异构混合推理(把推理拆成两步,让不同国产芯片各做擅长的事):通用处理器负责计算密集型的上下文理解,高端芯片负责内存带宽敏感的token生成
统一的网络、调度与缓存层把不同品牌、不同代际的国产芯片拼成一套系统。用大白话说= 不挑芯片牌子,能用的都编进同一条流水线。
商汤称该集群已实现正毛利,日均服务量从年初约4000亿token增至7月下旬约2.42万亿,年末目标10万亿
03

商汤给出的性能数字可信吗?

新发布的SenseNova U1 Pro基础模型宣称:国产芯片利用率(MFU)提升85%至152%,推理性价比达英伟达H系列的1.25倍,同等成本下token产出为后者的2.5倍
上述数据均为厂商自述,未经独立验证。 这反映出当前行业的一个共性问题:性能对标缺乏统一基准。
商汤还计划推出至少五个国产万卡集群,服务逾200家AI初创企业,落地地点包括盐城、香港及沙特阿拉伯。
04

曙光的十万卡超算集群能做什么?

曙光信息的"曙光8000"被称为中国首个全国产10万卡AI超算集群,基于海光DCU芯片,通过RDMA网络互联,在WAIC上获"镇馆之宝"称号。
该集群与郑州国家超算节点相连,可支撑中国当前token需求的5%至10%,同时承载约120万路AI对话。首周即满负荷运行,日均作业数超15万
这意味着→ 单个集群就能吃下全国需求的一小块,说明算力基础设施正在从"实验室规模"跨入"工业规模"。河南省AI产业规模已突破1000亿元人民币,算力目标为2026年底前扩容至120 EFLOPS
05

除了商汤和曙光,还有谁在押注这条路?

全栈云厂商幻方科技直接把平台命名为"Token Factory",青城AI推出"前店后厂"token模式——"token工厂"已从单一厂商标签变成行业共识。
硬件层面,华为昇腾950超节点(单系统算力达1 EFLOPS)斩获SAIL奖,沐曦与阿里巴巴自研芯片亦有展示。这反映出中国算力生态正系统性地绕开英伟达,用国产芯片构建推理产能。
腾讯云副总裁吴云生在会上提出"算token账":模糊任务交给消耗token多的智能体,确定性任务用更廉价的固定工作流。用大白话说= 不是所有问题都值得用最贵的方式回答,按任务类型分配算力才划算。
06

这条路最终能走通吗?

整个"token工厂"逻辑的核心是成本纪律——从每瓦、每块芯片中榨取更多可售token。中国厂商把推理经济性而非模型规模视为下一个竞争前沿。
但关键验证节点在于:国产混合推理集群能否在更大规模下持续维持正毛利。 商汤目前宣称已做到,但年末10万亿token的目标意味着产能还要再翻数倍。
这意味着→ "token工厂"不是一个已被证明的终局,而是一个正在押注的方向。规模放大后成本曲线能不能继续下降,是这场竞赛的真正悬念。

Content is for reference only, not financial advice.

WAIC 2026:中国AI竞争轴转向低成本token生产 · nashnova