Gemini 4 Pro疑似匿名上线,基准测试压制GPT-6与Claude

nashnova research
今天发布阅读约 4 分钟

一款疑似谷歌下一代旗舰模型Gemini 4 Pro的匿名模型悄然现身AI竞技场,多项基准测试全面领先GPT-6 Astra和Claude Fable 5.1——若数据属实,谷歌将在沉寂半年后重夺大模型性能榜首。

01

这个"匿名模型"是怎么被发现的?

大模型竞技场Arena近日出现一款叫"gemini-3.8-flash"的模型,但同名的Gemini 3.8 Flash早在9月初就已正式发布
这意味着→ 同一个名字再次出现极不正常,多位开发者实测后判断:这很可能是Gemini 4 Pro的早期检查点(训练过程中某个阶段的快照版本)在"借壳"测试。
用大白话说= 谷歌大概率在用旧名字偷偷跑新模型,不想提前曝光。
02

跑分到底有多强?

智能体编码任务DeepSWE v1.1得分88%,比GPT-6 Astra高约2个百分点
真实知识工作任务GDPval-AA v2拿到2064 Elo,是三款模型中唯一达到该分值的。
终端编码能力Terminal-bench 2.1得分95.3%,计算机操作能力OSWorld-2.0得分86.8%——编码和操作两项都处于顶级水平。
上述数据尚未经谷歌官方确认,目前仅来自开发者自行测试。
03

定价和技术规格透露了什么?

据AI研究员进入后端披露:支持1000万Token输入25.6万Token输出,具备永久跨会话记忆(对话关掉再开,模型还记得之前聊过什么),且无需调API即可联网。
每百万Token输入2.25美元,输出11.25美元,据报道低于Astra和Fable 5.1
这意味着→ 性能领先的同时价格还更低,如果属实,谷歌在"性价比"维度也在抢位。
04

"递归自我改进"是什么意思?

市场流传的说法是:Gemini 4 Pro之所以提前完成训练,是因为谷歌DeepMind在训练过程中实现了RSI闭环——递归自我改进(Recursive Self-Improvement,即模型在训练中不断优化自己的训练策略,形成正向循环)。
谷歌DeepMind首席战略官贾斯吉特·塞克洪此前公开表示,RSI已成为AI巨额投资逻辑的关键一环;谷歌同期还公开了一项名为Dream-RSI的研究。
用大白话说= 普通AI靠人类喂数据变聪明,RSI的意思是模型自己教自己、越跑越快——这也是为什么Gemini 4 Pro可能比预期更早出现。
05

对谷歌的竞争格局意味着什么?

谷歌上一个旗舰版本Gemini 3.1 Pro发布于今年2月,距今已超过半年;原定6月上线的Gemini 3.5 Pro因性能不及Flash而被取消
这意味着→ 谷歌在旗舰模型层面已经沉寂了两个产品周期,市场一度认为它在OpenAI和Anthropic面前掉队。
若Gemini 4 Pro的基准数据最终被验证,它将是谷歌时隔多月后重新确立旗舰竞争力的关键节点——从"追赶者"变回"领先者"的叙事转折。

市场有风险,内容仅供研究参考,不构成投资建议。

Gemini 4 Pro疑似匿名上线,基准测试压制GPT-6与Claude · nashnova