谷歌内部测试更强Gemini 4新版本,员工称媲美Anthropic旗舰

nashnova research
2026-10-09发布阅读约 3 分钟

谷歌正准备公开发布Gemini 4「Argon」模型,但内部已在测试代号Carbon的更强版本,有员工称其编程能力接近Anthropic最强模型——这意味着Gemini 4系列的真正实力可能还没亮出来。

01

Gemini 4家族里,Argon、Barium、Carbon到底是什么关系?

谷歌内部把Gemini 4系列按元素周期表命名:Argon → Barium → Carbon,代表三个递进版本。
即将对外发布的"Argon",实际上是内部代号Barium-B的版本——用大白话说=公众拿到的"第一版",其实已经是内部的第二轮迭代。
Carbon是目前最新、最强的内部测试版,但谷歌尚未决定它会以Argon的更新补丁发布,还是作为Gemini 4家族中的独立新模型推出。
02

员工说Carbon"像Opus 5.5"——这个评价有多高?

一名谷歌员工向《商业内幕》表示,Carbon"感觉像Opus 5.5"。Opus 5是Anthropic专为长时间自主编程任务设计的旗舰模型,5.5意味着比它还强一档。
这意味着→ 如果这个评价成立,Carbon在编程智能体(能自主写代码、调试的AI)领域已触及当前行业天花板。
不过该员工也强调"仍需进一步测试",内部频道里其他人的反馈更偏感性——"Carbon真的很棒!""新版本感觉相当不错"——尚未有系统性基准数据公开。
03

早期Argon表现如何?为什么Carbon的出现很关键?

谷歌上月宣布Gemini 4时强调,Argon在编程和知识类基准测试中达到前沿水准,涵盖法律、金融等领域,并突出其防御性网络安全能力。
但内部测试显示,早期Argon在部分编程任务上落后于Claude Opus 5(Anthropic上一代旗舰)。这反映出Argon并非在所有维度上全面领先。
Carbon的价值正在于此:它可能补上Argon在编程端的短板。但谷歌不保证会将Carbon对外发布——这意味着→ 公众最终拿到的产品,未必是谷歌手里最强的版本。
04

对AI编程赛道的格局意味着什么?

在AI编程智能体这条赛道上,Anthropic和OpenAI目前在开发者群体中已形成明显领先。谷歌是追赶者。
Gemini 4系列将首先向"Fairwind计划"合作伙伴开放,用于测试网络安全漏洞,之后才更广泛发布。
用大白话说=谷歌手里可能已有接近行业最强的编程模型,但能不能缩小差距,取决于两件事:Carbon是否对外发布,以及公开后实测表现是否撑得住内部员工的口碑。

市场有风险,内容仅供研究参考,不构成投资建议。