神秘模型ox-alpha程式設計測試超越GPT-5.6,技術指紋指向智譜未發布新模型
Nashnova编辑部
匿名模型ox-alpha在編程基準中Pass@1達80%,超越Claude和GPT-5.6;獨立研究者從四個技術維度判定其高度指向智譜未發佈的下一代旗艦,8月27日前後或將揭曉真實身份。
這個模型從哪冒出來的?
8月20日,一個叫stealth/ox-alpha的匿名模型悄然上線模型分發平台OpenRouter,無任何官方認領。
獨立研究員本·戴維斯(Ben Davis)對其進行系統測試後,在X平台表示他「99%確定」該模型屬於智譜GLM-5.x系列。
這意味著→ 如果判斷成立,智譜正在以「隱身測試」的方式驗證下一代多模態旗艦模型的真實水平。
憑甚麼說它是智譜的?
戴維斯從視頻編碼器、分詞器、音頻接口、輸出風格四個維度給出技術依據,其中視頻編碼器被認為最有力。
在四組受控視頻測試中,ox-alpha與GLM-5V-Turbo的視頻token消耗完全一致——兩者都呈現幀率無關的幀採樣方式、約每秒147 token的時長縮放比例,以及逐幀解像度縮放機制。
分詞器測試同樣吻合:25個提示詞測試後,ox-alpha的token計數與GLM-5.3完全一致,僅有固定的+75 token隱藏封裝差異。簡單來說=兩個模型很可能共用同一套詞彙表。
此外,ox-alpha拒絕音頻輸入,與GLM-5V行為一致;而主要候選對象MiMo v2.5支持音頻輸入——這進一步排除了後者的可能性。
編程能力到底強在哪?
在DeepSWE編程基準中,ox-alpha10個確定性任務通過8個,Pass@1達到80%。
對比來看:Claude Fable 5通過率65%,GLM-5.3和Grok 4.6均為62%,GPT-5.6-sol僅52%。
在一個此前所有對手均0/4的任務(meriyah-explicit-resource-declarations)中,ox-alpha一次通過。這意味著→ 它的能力已明顯強於GLM-5.3,更像是下一代模型檢查點,而非簡單變體。
它有多大?誰在背後運營?
ox-alpha的解碼速度與GLM-5V-Turbo相差僅約6%。後者擁有744B總參數、40B激活參數。
戴維斯據此推測ox-alpha可能採用類似規模的MoE架構(MoE,混合專家模型——不是所有參數同時工作,而是每次只激活其中一小部分)。
簡單來說=如果激活參數確實在40B左右,運營方聲稱的每日100萬億token服務能力在成本和算力層面才說得通。
甚麼時候能確認身份?
智譜此前已有通過隱身渠道測試模型的先例——Pony Alpha最終被確認與GLM-5有關。
ox-alpha目前處於免費訪問窗口,可能持續至8月27日。此前類似隱身模型也曾在免費測試結束後由相關中國AI實驗室正式認領。
這反映出一種正在成形的行業策略:先匿名放出、收集真實用戶反饋和基準數據,再擇機官宣——8月27日前後或將成為關鍵驗證節點。
Content is for reference only, not financial advice.