WAIC 2026:中國AI競爭軸轉向低成本token生產
Taylor Wilson
上海世界人工智能大會上,「token工廠」成為核心議題——中國AI產業競爭焦點正從模型參數和晶片數量,轉向每個token的推理成本與盈利能力,這意味著行業進入「誰能更便宜地產出智能」的新階段。
點解突然人人都講「token工廠」?
中國模型即服務市場的企業token消耗量,從2025年1月的日均約1.6萬億個飆升至年底的約9.6萬億個,不到一年翻了近六倍。
這意味著→ 需求已經大到「模型好不好」不再是唯一問題,「跑一次推理花幾多錢」成了決定性指標。
簡單來說= 以前鬥誰的模型更大更聰明,現在鬥誰能用更低成本「生產」出每一個回答。這就是「token工廠」邏輯的起點。
商湯的方案:用不同晶片做不同工序,點樣實現?
商湯旗下SenseCore提出異構混合推理(將推理拆成兩步,讓不同國產晶片各做擅長的事):通用處理器負責計算密集型的上下文理解,高端晶片負責記憶體頻寬敏感的token生成。
統一的網絡、調度與緩存層將不同品牌、不同代際的國產晶片整合為一套系統。簡單來說= 不揀晶片牌子,能用的統統編入同一條流水線。
商湯稱該集群已實現正毛利,日均服務量從年初約4000億token增至7月下旬約2.42萬億,年末目標10萬億。
商湯給出的性能數字可信嗎?
新發佈的SenseNova U1 Pro基礎模型宣稱:國產晶片利用率(MFU)提升85%至152%,推理性價比達NVIDIA H系列的1.25倍,同等成本下token產出為後者的2.5倍。
上述數據均為廠商自述,未經獨立驗證。 這反映出當前行業的一個共性問題:性能對標缺乏統一基準。
商湯還計劃推出至少五個國產萬卡集群,服務逾200家AI初創企業,落地地點包括鹽城、香港及沙特阿拉伯。
曙光的十萬卡超算集群能做到甚麼?
曙光信息的「曙光8000」被稱為中國首個全國產10萬卡AI超算集群,基於海光DCU晶片,通過RDMA網絡互聯,在WAIC上獲「鎮館之寶」稱號。
該集群與鄭州國家超算節點相連,可支撐中國當前token需求的5%至10%,同時承載約120萬路AI對話。首周即滿負荷運行,日均作業數超15萬。
這意味著→ 單個集群就能吃下全國需求的一小塊,説明算力基礎設施正在從「實驗室規模」跨入「工業規模」。河南省AI產業規模已突破1000億元人民幣,算力目標為2026年底前擴容至120 EFLOPS。
除了商湯同曙光,仲有邊個押注呢條路?
全棧雲廠商幻方科技直接將平台命名為「Token Factory」,青城AI推出「前店後廠」token模式——「token工廠」已從單一廠商標籤變成行業共識。
硬件層面,華為昇騰950超節點(單系統算力達1 EFLOPS)斬獲SAIL獎,沐曦與阿里巴巴自研晶片亦有展示。這反映出中國算力生態正系統性地繞開NVIDIA,用國產晶片構建推理產能。
騰訊雲副總裁吳雲生在會上提出「算token賬」:模糊任務交給消耗token多的智能體,確定性任務用更廉價的固定工作流。簡單來說= 不是所有問題都值得用最貴的方式回答,按任務類型分配算力先至划算。
呢條路最終行唔行得通?
整個「token工廠」邏輯的核心是成本紀律——從每瓦、每塊晶片中榨取更多可售token。中國廠商將推理經濟性而非模型規模視為下一個競爭前沿。
但關鍵驗證節點在於:國產混合推理集群能否在更大規模下持續維持正毛利。 商湯目前宣稱已做到,但年末10萬億token的目標意味著產能還要再翻數倍。
這意味著→ 「token工廠」不是一個已被證明的終局,而是一個正在押注的方向。規模放大後成本曲線能不能繼續下降,是這場競賽的真正懸念。
Content is for reference only, not financial advice.