智譜AI:GLM驅動Infra Agent優化自身推理系統

nashnova research
今天发布阅读约 4 分钟

智譜GLM-5.3-Flash在超10萬顆國產AI加速器集群上完成部署,端到端吞吐提升約3.2倍——完成大量優化工作的不只是人類工程師,還有一個由GLM自身驅動的基礎設施Agent,首席科學家唐傑將其定性為遞歸自我改進的早期形態。

01

10萬顆國產晶片上跑大模型,難在哪?

國產AI加速器的顯存容量和互聯頻寬都比NVIDIA GPU更受限,同時軟件生態尚未成熟,部分算子(晶片上執行特定計算的基本單元)支持不足。
模型還需支持100萬token長上下文和多模態請求——這意味著→ 每一顆晶片上的記憶體壓力和數據搬運壓力同時拉滿。
簡單來說= 硬件天花板更低、軟件工具更少,卻要跑同樣複雜的任務,相當於在一條更窄的路上跑同樣大的車。
02

智譜用了哪些辦法繞過硬件瓶頸?

ReplaySSM以計算換記憶體空間,配合節點內張量並行(把一層計算拆到多張卡上同時算)降低單卡顯存壓力。
引入INT8/FP8/BF16混合精度緩存,不同數據用不同精度存儲,提升容量利用率。
架構層面採用EPD分離式設計(編碼-預填充-解碼三階段各自獨立調度),令不同階段的資源分配更靈活。
最終效果:硬件利用率和單token成本接近主流NVIDIA GPU平台水平
03

AI自己優化自己的系統——Infra Agent做了甚麼?

智譜讓GLM-5.3驅動一個基礎設施Agent,給它接入「dense feedback」——包括計算正確性反饋、系統運行時間數據、新方案的實驗驗證結果。
Agent發現了一個精度累積bug:TF32計算產生的捨入誤差隨序列變長不斷疊加,修復已合併至開源項目Flash Linear Attention的PR #1180。
Agent還定位到KV Transfer與DeepEP調度的重疊缺失——節點內路徑未及時釋放Python GIL(全局解釋器鎖,控制同一時刻只有一個線程執行的機制),導致傳輸開銷超過30%,修復後降至1%以下
另一項優化:Agent重組了一個解碼算子的計算結構,消除同一組歸一化計算被重複執行四次的問題,性能提升1.71倍
04

這算「遞歸自我改進」嗎?

首席科學家唐傑的定性:這是遞歸自我改進(RSI)的早期形態——模型參與優化承載自身運行的系統,系統改善又影響下一代模型的訓練和部署。
但他同時強調,距離真正意義上的RSI仍然很遠,當前只是「一個最小規模的循環已經出現」。
這反映出 一個關鍵信號:AI不再只是被優化的對象,它開始參與優化自己運行的基礎設施——哪怕目前只是輔助角色。
05

工程師的角色會怎麼變?

人類工程師仍負責設定目標、搭建反饋環境、審核高風險修改,而角色正從「直接解決每一個問題的人」轉向「設計反饋系統的人」。
這意味著→ 工程師的核心能力從「寫代碼修bug」向「設計令Agent能自主發現和修復問題的環境」遷移。
智譜團隊認為,每一次Agent完成工程任務都可能成為下一代模型的訓練數據——這個循環能否持續擴大規模,是驗證該路線實際價值的關鍵。
06

實戰驗證:匿名上線一週表現如何?

部署完成後,GLM-5.3-Flash以匿名名稱「Ox-Alpha」在OpenCode和OpenRouter平台運行測試。
一週內成為兩個平台使用量最高的模型之一,六天內處理超過62萬億token
簡單來說= 不靠品牌、不靠宣傳,匿名丟進開放平台讓用戶盲測,用量自己說話——這是對部署效果最直接的檢驗。

市场有风险,内容仅供研究参考,不构成投资建议。

智譜AI:GLM驅動Infra Agent優化自身推理系統 · nashnova