谷歌內部測試更強Gemini 4新版本,員工稱媲美Anthropic旗艦
nashnova research
Google正準備公開發布Gemini 4「Argon」模型,但內部已在測試代號Carbon的更強版本,有員工稱其編程能力接近Anthropic最強模型——這意味著Gemini 4系列的真正實力可能尚未完全展露。
Gemini 4家族裡,Argon、Barium、Carbon到底是甚麼關係?
Google內部把Gemini 4系列按元素週期表命名:Argon → Barium → Carbon,代表三個遞進版本。
即將對外發布的「Argon」,實際上是內部代號Barium-B的版本——簡單來說=公眾拿到的「第一版」,其實已經是內部的第二輪迭代。
Carbon是目前最新、最強的內部測試版,但Google尚未決定它會以Argon的更新補丁發布,還是作為Gemini 4家族中的獨立新模型推出。
員工說Carbon「像Opus 5.5」——這個評價有多高?
一名Google員工向《商業內幕》表示,Carbon「感覺像Opus 5.5」。Opus 5是Anthropic專為長時間自主編程任務設計的旗艦模型,5.5意味著比它還強一檔。
這意味著→ 若評價屬實,Carbon在編程智能體(能自主寫代碼、調試的AI)領域已觸及當前行業天花板。
不過該員工亦強調「仍需進一步測試」,內部頻道其他人的反饋更偏感性——「Carbon真的很棒!」「新版本感覺相當不錯」——尚未有系統性基準數據公開。
早期Argon表現如何?為甚麼Carbon的出現很關鍵?
Google上月宣布Gemini 4時強調,Argon在編程和知識類基準測試中達到前沿水準,涵蓋法律、金融等領域,並突出其防禦性網絡安全能力。
但內部測試顯示,早期Argon在部分編程任務上落後於Claude Opus 5(Anthropic上一代旗艦)。這反映出Argon並非在所有維度上全面領先。
Carbon的價值正在於此:它可能補上Argon在編程端的短板。但Google不保證會將Carbon對外發布——這意味著→ 公眾最終拿到的產品,未必是Google手中最強的版本。
對AI編程賽道的格局意味著甚麼?
在AI編程智能體這條賽道上,Anthropic和OpenAI目前在開發者群體中已形成明顯領先。Google是追趕者。
Gemini 4系列將首先向「Fairwind計劃」合作夥伴開放,用於測試網絡安全漏洞,之後才更廣泛發布。
說白了=Google手中可能已有接近行業最強的編程模型,但能否縮小差距,取決於兩件事:Carbon是否對外發布,以及公開後實測表現是否撐得住內部員工的口碑。
市场有风险,内容仅供研究参考,不构成投资建议。
