中国AI竞争轴从模型转向芯片:智谱GLM-5.3-Flash或调用逾10万颗国产AI芯片

Nashnova编辑部
今天发布阅读约 3 分钟

智谱以匿名身份将新模型GLM-5.3-Flash挂上国际平台OpenRouter,据行业消息人士称其推理可能调用了逾10万颗国产AI芯片——中国AI竞争的核心问题正从「谁的模型更强」变成「模型能不能在国产芯片上跑起来」。

01

为什么要匿名上线?

8月20日,智谱把新模型以化名「Ox Alpha」挂上模型聚合平台OpenRouter,不标来源,只说支持编程和AI Agent,预览期免费。6天后才公开承认这就是GLM-5.3-Flash。
这意味着→ 匿名不只是营销噱头,而是一次真实环境压力测试:让全球开发者在不知道「这是中国模型」的情况下真刀真枪地用,测的不是跑分,而是生产环境下能不能扛住。
用大白话说= 先让市场盲测给出真实反馈,再亮牌——证明的是「用起来行不行」,不是「参数表好不好看」。
02

模型本身有什么特别?

GLM-5.3-Flash采用MoE架构(混合专家架构:模型内部有多组「专家」模块,每次只调用最相关的一小组来回答问题,不用全部启动),总参数3200亿,但每次推理仅激活约180亿参数。
这意味着→ 保留了大模型的知识容量,同时把单次推理的算力消耗压到很低——这对依赖国产芯片的算力集群尤其关键,因为单颗芯片性能不如英伟达,就更需要在架构上省着用
匿名测试期间,Ox Alpha一度成为OpenRouter上使用量最高的模型,据报某时段使用量超过DeepSeek的两倍。
03

「逾10万颗国产芯片」意味着什么?

据行业消息人士称,GLM-5.3-Flash的推理可能调用了逾10万颗国产AI芯片,潜在供应商包括华为昇腾、摩尔线程、海光信息。智谱尚未公开证实。
这意味着→ 如果属实,这是国产AI芯片第一次在商业规模推理场景中被大规模验证——不是实验室里跑一次基准测试,而是真实用户持续发请求、持续消耗算力。
用大白话说= 训练一个大模型像盖一座工厂,是一次性的;但模型上线后每回答一个问题、每执行一个任务,都在持续烧芯片算力。10万颗芯片扛住了这个负载,才说明国产芯片真的能用。
04

为什么说竞争轴已经转移?

大模型进入商业部署后,持续推理的算力消耗往往超过一次性训练。每一条查询、每一个Agent任务、每一段代码生成,都在消耗芯片资源。
这反映出中国AI竞争已从算法层延伸到芯片与算力集群层:国产芯片厂商需要证明的不只是峰值算力(TOPS),还包括大规模推理下的稳定性、模型兼容性和软件生态成熟度。
这意味着→ 下一阶段最值得追踪的不是「谁又发了新模型」,而是国产硬件能否在商业规模下持续兑现——GLM-5.3-Flash的这次测试,是这条验证链上目前最具说服力的一个节点。

市场有风险,内容仅供研究参考,不构成投资建议。

中国AI竞争轴从模型转向芯片:智谱GLM-5.3-Flash或调用逾10万颗国产AI芯片 · nashnova