瑞銀調研:開源模型Token份額急升,推理算力全面告急

Taylor Wilson
Published todayAbout 5 min read

瑞銀調研顯示企業級開源模型Token佔比半年內從0.1%飆升至10%以上,但推理算力供給已全面緊缺——Kimi 3上線48小時即觸及算力上限,Databricks多區域GPU告罄。

01

開源模型Token份額半年翻了100倍,錢去了哪裏?

某AI企業披露:今年1月開源模型僅佔企業總Token量0.1%,兩個月後升至1%,目前已遠超10%;該機構預測12個月內將突破90%
這意味著→ 企業用開源模型跑的任務量正以指數級增長,但這不等於開源賺到了錢——90%以上算力支出仍投向閉源前沿模型
簡單來說= 開源模型搶走了「跑量」的活,但高價值、高難度的核心業務場景,客戶仍願意為閉源模型付高價。頭部模型廠商在此類場景中依然握有定價權
第三方佐證:Together AI數據顯示開源Token消耗佔比一年內從10%升至30%;開源模型性能落後閉源頭部約90天,但運行成本僅為後者的10%至30%
02

企業AI賬單漲了多少?為甚麼有人不在乎?

瑞銀測算約60%企業將AI算力成本列為核心痛點。實例:某金融機構Claude採購訂單3個月內從1000萬美元增至6000萬美元;某銀行每月在Opus 4.8推理上花費數十萬美元,其中大量屬低複雜度查詢。
一家AI原生企業對Anthropic的月度支出從去年12月的2萬美元飆升至今年7月近100萬美元——但公司營收增速更快,應對方式是設用量上限,而非縮減部署。
這意味著→ 成本暴漲並不必然觸發降本——當AI帶來的收入增長跑贏支出增長時,企業選擇控量而非砍單
AI智能體(讓AI自動完成多步驟任務的程式)的循環重試機制會將單次流程Token消耗放大10至100倍。某客戶單部門Claude支出甚至超過該部門全員薪酬,同時仍在持續擴招。
03

按量計費時代來了,誰最先感到痛?

微軟6月1日起將GitHub Copilot(AI編程助手)全面改為按Token計費,參會企業普遍認為此舉加速了成本優化訴求。
但約60%客戶初次選定模型後長期不更換。這反映出企業在模型切換上存在明顯慣性——換模型的遷移成本和驗證周期令多數客戶選擇「不動」。
算力調度路由平台(自動為不同任務匹配最優模型的中間層)通過調度結合部分遷移至自研低價模型,平均可為客戶節省20%至30%算力開支。
這意味著→ 在按量計費的新規則下,「幫客戶慳錢」本身就是一門好生意,算力調度類產品的價值空間被打開。
04

推理算力到底有多緊缺?

月之暗面旗下Kimi 3上線48小時即觸及算力上限,已暫停新用戶訂閱。同時託管Kimi及多款開源模型的Databricks多區域GPU全面緊缺,本輪融資核心目的就是購入GPU。
Fireworks最新營收突破10億美元(今年1月僅4億),日處理超40萬億Token,同步完成10億美元融資,投後估值175億美元;Baseten日處理30萬億Token,管理層稱流量或已超過OpenAI官方API。
閉源頭部方面,Anthropic與谷歌近期已從SpaceX鎖定額外算力。瑞銀供應鏈調研顯示,未來數年OpenAI、Anthropic還將新增數十萬GW級算力儲備
簡單來說= 不論開源還是閉源,大家都在搶GPU。推理側的算力缺口已經從「可能出現」變成「正在發生」。
05

英偉達Nemotron為何突然被熱議?開源落地還差甚麼?

英偉達Nemotron是本次峰會提及頻次最高的美國本土開源模型,半年前幾乎無人討論。這反映出2025年12月Nemotron 3正式發布後,英偉達在開源生態中的存在感快速上升。
但開源落地仍有硬約束:某服務商披露平台80%算力流量依舊走Claude;所有金融、政務等強監管行業客戶均拒絕部署特定大模型
這意味著→ 開源模型在Token用量上的份額暴漲,並不意味著它在高價值場景中被信任。監管合規和模型可靠性仍是閉源的護城河。
算力供給能否跟上Token消耗的指數級增長,將決定上述推理平台估值能否持續兌現——這是當前AI基礎設施賽道最核心的懸念。

Content is for reference only, not financial advice.

瑞銀調研:開源模型Token份額急升,推理算力全面告急 · nashnova