智谱AI:GLM驱动Infra Agent优化自身推理系统
nashnova research
智谱GLM-5.3-Flash在超10万颗国产AI加速器集群上完成部署,端到端吞吐提升约3.2倍——完成大量优化工作的不只是人类工程师,还有一个由GLM自身驱动的基础设施Agent,首席科学家唐杰将其定性为递归自我改进的早期形态。
10万颗国产芯片上跑大模型,难在哪?
国产AI加速器的显存容量和互联带宽都比英伟达GPU更受限,同时软件生态尚不成熟,部分算子(芯片上执行特定计算的基本单元)支持不足。
模型还需支持100万token长上下文和多模态请求——这意味着→ 每一颗芯片上的内存压力和数据搬运压力同时拉满。
用大白话说= 硬件天花板更低、软件工具更少,却要跑同样复杂的任务,相当于在一条更窄的路上跑同样大的车。
智谱用了哪些办法绕过硬件瓶颈?
用ReplaySSM以计算换内存空间,配合节点内张量并行(把一层计算拆到多张卡上同时算)降低单卡显存压力。
引入INT8/FP8/BF16混合精度缓存,不同数据用不同精度存储,提升容量利用率。
架构层面采用EPD分离式设计(编码-预填充-解码三阶段各自独立调度),让不同阶段的资源分配更灵活。
最终效果:硬件利用率和单token成本接近主流英伟达GPU平台水平。
AI自己优化自己的系统——Infra Agent做了什么?
智谱让GLM-5.3驱动一个基础设施Agent,给它接入"dense feedback"——包括计算正确性反馈、系统运行时间数据、新方案的实验验证结果。
Agent发现了一个精度累积bug:TF32计算产生的舍入误差随序列变长不断叠加,修复已合并至开源项目Flash Linear Attention的PR #1180。
Agent还定位到KV Transfer与DeepEP调度的重叠缺失——节点内路径未及时释放Python GIL(全局解释器锁,控制同一时刻只有一个线程执行的机制),导致传输开销超过30%,修复后降至1%以下。
另一项优化:Agent重组了一个解码算子的计算结构,消除同一组归一化计算被重复执行四次的问题,性能提升1.71倍。
这算"递归自我改进"吗?
首席科学家唐杰的定性:这是递归自我改进(RSI)的早期形态——模型参与优化承载自身运行的系统,系统改善又影响下一代模型的训练和部署。
但他同时强调,距离真正意义上的RSI仍然很远,当前只是"一个最小规模的循环已经出现"。
这反映出 一个关键信号:AI不再只是被优化的对象,它开始参与优化自己运行的基础设施——哪怕目前只是辅助角色。
工程师的角色会怎么变?
人类工程师仍负责设定目标、搭建反馈环境、审核高风险修改,但角色正从"直接解决每一个问题的人"转向"设计反馈系统的人"。
这意味着→ 工程师的核心能力从"写代码修bug"向"设计让Agent能自主发现和修复问题的环境"迁移。
智谱团队认为,每一次Agent完成工程任务都可能成为下一代模型的训练数据——这个循环能否持续扩大规模,是验证该路线实际价值的关键。
实战验证:匿名上线一周表现如何?
部署完成后,GLM-5.3-Flash以匿名名称"Ox-Alpha"在OpenCode和OpenRouter平台运行测试。
一周内成为两个平台使用量最高的模型之一,六天内处理超过62万亿token。
用大白话说= 不靠品牌、不靠宣传,匿名丢进开放平台让用户盲测,用量自己说话——这是对部署效果最直接的检验。
市场有风险,内容仅供研究参考,不构成投资建议。
