智譜API用戶近700萬,啟用逾5萬塊國產算力晶片
N.R. Finch
智譜開放平台API用戶逼近700萬、企業客戶達2.3萬家,年化經常性收入(ARR)年內增長15倍。這意味著→ 中國大模型API市場正從「試用」切換到「生產級付費」,而智譜用5萬塊國產晶片+自研推理架構回應算力缺口,把效率做成了定價權。
700萬用戶、15倍ARR——這些數字說明甚麼?
智譜MaaS平台註冊用戶近700萬,7月以來新增約200萬;企業客戶2.3萬家。
對標OpenAI Codex的開發者產品ZCode上線一個月即破百萬用戶,編程場景是當前增長最快的入口。
年內ARR增長15倍。有投資人透露已達20億美元,智譜官方否認並暗示實際更高。這意味著→ 即使按20億美元算,註冊用戶月均消費僅約160元人民幣——單價低、但用戶基數帶來的總量已非常可觀。
一個模型發佈怎麼就令收入翻倍?
GLM-5於2026年2月發佈,發佈前ARR約1億美元,發佈後短期內即翻倍。
據Artificial Analysis評測,GLM-5發佈時全球排名第四,僅次於Anthropic兩款頂級模型和OpenAI GPT-5.2。
簡單來說= 前沿模型是API平台最強的獲客工具——性能排名靠前,開發者就願意把調用切過來,收入跟著漲。
實體晶片不夠用,效率怎麼補?
智譜已啟用逾5萬塊國產算力晶片,但硬件擴展速度跟不上推理需求增長,轉而押注算法層效率。
7月完成對中科加禾的收購,通過分拆KV緩存(一種令模型在長對話中「記住」上下文的緩存機制),長程任務場景單服務吞吐最高提升132%。
自研推理網絡架構ZCube可將生產集群整體吞吐提升最高15%,同時將交換機與光模組需求削減多達三分之一。這意味著→ 同樣的晶片跑出更多token,算力瓶頸被「軟件化」地緩解。
GLM-5.2的架構改動到底在省甚麼?
IndexShare技術:百萬token場景下,單位token計算量降低2.9倍。簡單來說= 上下文越長,省得越多——這對編程和長文檔場景尤其關鍵。
改進後的MTP草稿層(一種令模型一次「猜」更多字再校驗的加速技巧)接受長度提升20%,生成速度隨之提升約兩成。
實測對比:處理20萬token上下文時,GLM-5.2吞吐是基準的4.7倍,而GLM-5.1僅2.77倍,差距接近70%。
API毛利率能撐住這個增長速度嗎?
智譜API在自有算力上運轉時毛利率可達50%–60%。作為參照,Anthropic超過80%,DeepSeek約70%–80%。
GLM-5.2混合價格約8.8元/百萬token,顯著低於美國同性能模型。這反映出 智譜在用價格換規模,而推理效率的提升正在把低價策略從「燒錢」拉向「可持續」。
7月Kimi發佈K3期間,智譜API用戶增長和ARR增速均未受影響。說白了= 當前token市場還遠未到零和博弈,增量空間仍在。
錢從哪來、花到哪去?
7月港股配售一個下午完成認購,最終募資超300億港元,其中55%用於研發,涵蓋算力採購與人才擴充。
一位投資人對《晚點LatePost》表示:Infra層優化將是未來一兩年AI投資的重要主題——模型能力趨同後,誰能把同樣的晶片跑出更多token,誰的商業賬就更好看。
這意味著→ 算力瓶頸能否通過效率持續對沖,是智譜ARR增速能否維持的關鍵驗證節點。
Content is for reference only, not financial advice.