Gemini 4 Pro疑似匿名上線,基準測試壓制GPT-6與Claude

nashnova research
今天发布阅读约 4 分钟

一款疑似Google下一代旗艦模型Gemini 4 Pro的匿名模型悄然現身AI競技場,多項基準測試全面領先GPT-6 Astra和Claude Fable 5.1——若數據屬實,Google將在沉寂半年後重奪大模型性能榜首。

01

這個「匿名模型」是怎樣被發現的?

大模型競技場Arena近日出現一款叫「gemini-3.8-flash」的模型,但同名的Gemini 3.8 Flash早在9月初就已正式發布
這意味著→ 同一個名字再次出現極不正常,多位開發者實測後判斷:這很可能是Gemini 4 Pro的早期檢查點(訓練過程中某個階段的快照版本)在「借殼」測試。
簡單來說= Google大概率在用舊名字偷偷跑新模型,不想提前曝光。
02

跑分到底有多強?

智能體編碼任務DeepSWE v1.1得分88%,比GPT-6 Astra高約2個百分點
真實知識工作任務GDPval-AA v2拿到2064 Elo,是三款模型中唯一達到該分值的。
終端編碼能力Terminal-bench 2.1得分95.3%,電腦操作能力OSWorld-2.0得分86.8%——編碼和操作兩項都處於頂級水平。
上述數據尚未經Google官方確認,目前僅來自開發者自行測試。
03

定價和技術規格透露了甚麼?

據AI研究員進入後端披露:支持1000萬Token輸入25.6萬Token輸出,具備永久跨會話記憶(對話關掉再開,模型還記得之前聊過甚麼),而且無需調API即可聯網。
每百萬Token輸入2.25美元,輸出11.25美元,據報道低於Astra和Fable 5.1
這意味著→ 性能領先的同時價格還更低,如果屬實,Google在「性價比」維度也在搶位。
04

「遞歸自我改進」是甚麼意思?

市場流傳的說法是:Gemini 4 Pro之所以提前完成訓練,是因為Google DeepMind在訓練過程中實現了RSI閉環——遞歸自我改進(Recursive Self-Improvement,即模型在訓練中不斷優化自己的訓練策略,形成正向循環)。
Google DeepMind首席戰略官贾斯吉特·塞克洪此前公開表示,RSI已成為AI巨額投資邏輯的關鍵一環;Google同期還公開了一項名為Dream-RSI的研究。
簡單來說= 普通AI靠人類餵數據變聰明,RSI的意思是模型自己教自己、越跑越快——這也是為甚麼Gemini 4 Pro可能比預期更早出現。
05

對Google的競爭格局意味著甚麼?

Google上一個旗艦版本Gemini 3.1 Pro發布於今年2月,距今已超過半年;原定6月上線的Gemini 3.5 Pro因性能不及Flash而被取消
這意味著→ Google在旗艦模型層面已經沉寂了兩個產品週期,市場一度認為它在OpenAI和Anthropic面前掉隊。
若Gemini 4 Pro的基準數據最終被驗證,它將是Google時隔多月後重新確立旗艦競爭力的關鍵節點——從「追趕者」變回「領先者」的敘事轉折。

市场有风险,内容仅供研究参考,不构成投资建议。

Gemini 4 Pro疑似匿名上線,基準測試壓制GPT-6與Claude · nashnova