智谱API用户近700万,启用逾5万块国产算力芯片
N.R. Finch
智谱开放平台API用户逼近700万、企业客户达2.3万家,年化经常性收入(ARR)年内增长15倍。这意味着→ 中国大模型API市场正从「试用」切换到「生产级付费」,而智谱用5万块国产芯片+自研推理架构回应算力缺口,把效率做成了定价权。
700万用户、15倍ARR——这些数字说明什么?
智谱MaaS平台注册用户近700万,7月以来新增约200万;企业客户2.3万家。
对标OpenAI Codex的开发者产品ZCode上线一个月即破百万用户,编程场景是当前增长最快的入口。
年内ARR增长15倍。有投资人透露已达20亿美元,智谱官方否认并暗示实际更高。这意味着→ 即使按20亿美元算,注册用户月均消费仅约160元人民币——单价低、但用户基数带来的总量已非常可观。
一个模型发布怎么就让收入翻倍?
GLM-5于2026年2月发布,发布前ARR约1亿美元,发布后短期内即翻倍。
据Artificial Analysis评测,GLM-5发布时全球排名第四,仅次于Anthropic两款顶级模型和OpenAI GPT-5.2。
用大白话说= 前沿模型是API平台最强的获客工具——性能排名靠前,开发者就愿意把调用切过来,收入跟着涨。
物理芯片不够用,效率怎么补?
智谱已启用逾5万块国产算力芯片,但硬件扩展速度跟不上推理需求增长,转而押注算法层效率。
7月完成对中科加禾的收购,通过分拆KV缓存(一种让模型在长对话中"记住"上下文的缓存机制),长程任务场景单服务吞吐最高提升132%。
自研推理网络架构ZCube可将生产集群整体吞吐提升最高15%,同时将交换机与光模块需求削减多达三分之一。这意味着→ 同样的芯片跑出更多token,算力瓶颈被"软件化"地缓解。
GLM-5.2的架构改动到底在省什么?
IndexShare技术:百万token场景下,单位token计算量降低2.9倍。用大白话说= 上下文越长,省得越多——这对编程和长文档场景尤其关键。
改进后的MTP草稿层(一种让模型一次"猜"更多字再校验的加速技巧)接受长度提升20%,生成速度随之提升约两成。
实测对比:处理20万token上下文时,GLM-5.2吞吐是基准的4.7倍,而GLM-5.1仅2.77倍,差距接近70%。
API毛利率能撑住这个增长速度吗?
智谱API在自有算力上运转时毛利率可达50%–60%。作为参照,Anthropic超过80%,DeepSeek约70%–80%。
GLM-5.2混合价格约8.8元/百万token,显著低于美国同性能模型。这反映出 智谱在用价格换规模,而推理效率的提升正在把低价策略从"烧钱"拉向"可持续"。
7月Kimi发布K3期间,智谱API用户增长和ARR增速均未受影响。用大白话说= 当前token市场还远没到零和博弈,增量空间仍在。
钱从哪来、花到哪去?
7月港股配售一个下午完成认购,最终募资超300亿港元,其中55%用于研发,涵盖算力采购与人才扩充。
一位投资人对《晚点LatePost》表示:Infra层优化将是未来一两年AI投资的重要主题——模型能力趋同后,谁能把同样的芯片跑出更多token,谁的商业账就更好看。
这意味着→ 算力瓶颈能否通过效率持续对冲,是智谱ARR增速能否维持的关键验证节点。
Content is for reference only, not financial advice.