神秘模型ox-alpha编程测试超越GPT-5.6,技术指纹指向智谱未发布新模型

Nashnova编辑部
Published todayAbout 4 min read

匿名模型ox-alpha在编程基准中Pass@1达80%,超越Claude和GPT-5.6;独立研究者从四个技术维度判定其高度指向智谱未发布的下一代旗舰,8月27日前后或将揭晓真实身份

01

这个模型从哪冒出来的?

8月20日,一个叫stealth/ox-alpha的匿名模型悄然上线模型分发平台OpenRouter,没有任何官方认领。
独立研究员本·戴维斯(Ben Davis)对其进行系统测试后,在X平台表示他"99%确定"该模型属于智谱GLM-5.x系列。
这意味着→ 如果判断成立,智谱正在以"隐身测试"的方式验证下一代多模态旗舰模型的真实水平。
02

凭什么说它是智谱的?

戴维斯从视频编码器、分词器、音频接口、输出风格四个维度给出技术依据,其中视频编码器被认为最有力。
在四组受控视频测试中,ox-alpha与GLM-5V-Turbo的视频token消耗完全一致——两者都呈现帧率无关的帧采样方式、约每秒147 token的时长缩放比例,以及逐帧分辨率缩放机制。
分词器测试同样吻合:25个提示词测试后,ox-alpha的token计数与GLM-5.3完全一致,仅有固定的+75 token隐藏封装差异。用大白话说=两个模型很可能共用同一套词汇表。
此外,ox-alpha拒绝音频输入,与GLM-5V行为一致;而主要候选对象MiMo v2.5支持音频输入——这进一步排除了后者的可能性。
03

编程能力到底强在哪?

在DeepSWE编程基准中,ox-alpha10个确定性任务通过8个,Pass@1达到80%
对比来看:Claude Fable 5通过率65%,GLM-5.3和Grok 4.6均为62%,GPT-5.6-sol仅52%
在一个此前所有对手均0/4的任务(meriyah-explicit-resource-declarations)中,ox-alpha一次通过。这意味着→ 它的能力已明显强于GLM-5.3,更像是下一代模型检查点,而非简单变体。
04

它有多大?谁在背后运营?

ox-alpha的解码速度与GLM-5V-Turbo相差仅约6%。后者拥有744B总参数、40B激活参数
戴维斯据此推测ox-alpha可能采用类似规模的MoE架构(MoE,混合专家模型——不是所有参数同时工作,而是每次只激活其中一小部分)。
用大白话说=如果激活参数确实在40B左右,运营方声称的每日100万亿token服务能力在成本和算力层面才说得通。
05

什么时候能确认身份?

智谱此前已有通过隐身渠道测试模型的先例——Pony Alpha最终被确认与GLM-5有关
ox-alpha目前处于免费访问窗口,可能持续至8月27日。此前类似隐身模型也曾在免费测试结束后由相关中国AI实验室正式认领。
这反映出一种正在成形的行业策略:先匿名放出、收集真实用户反馈和基准数据,再择机官宣——8月27日前后或将成为关键验证节点

Content is for reference only, not financial advice.

神秘模型ox-alpha编程测试超越GPT-5.6,技术指纹指向智谱未发布新模型 · nashnova