谷歌新AI模型Gemini 3.8 Flash編程能力追近Anthropic
nashnova research
Google DeepMind最快本週三發布輕量級模型Gemini 3.8 Flash,內部測試中編程表現已超越Anthropic旗艦Opus;但Google真正的旗艦Pro系列仍延期數月,輕量級模型的突破暫時無法填補頂級模型的缺位。
3.8 Flash到底強在哪?
在Google內部編程工具Jetski的對比測試中,工程師對3.8 Flash的偏好程度超過了Anthropic的Opus模型。
這意味著→ 在編程這個當前AI最直接的商業應用場景上,Google的輕量級模型已追上甚至反超對手的旗艦。
不過,3.8 Flash屬於Flash系列——設計目標是體積更小、成本更低、速度更快,參數規模遠不及最頂級的旗艦模型。
輕量模型強了,為什麼還不夠?
簡單來說= Flash系列是「經濟艙」,跑得快、便宜,但它再好也代替不了「頭等艙」Pro系列在前沿能力上的地位。
Google最強的Pro系列已落後發布計劃數月。CEO皮查伊今年5月說「下個月發」,但內部候選版本因性能提升不足以超越Flash而被放棄。
這反映出一個結構性問題:Flash系列體量小,多個團隊可以同時試不同方案、快速迭代;Pro系列每次調整都要動用大量計算資源,天然迭代更慢。
Google把資源押在了哪裡?
今年以來,Google持續向編程能力傾斜——更多研究人員和算力投入這一方向。
重點加碼的是強化學習(reinforcement learning,在訓練後期通過試錯教模型掌握技能的環節)。
Google近期從OpenAI挖來巴雷特·佐夫(Barret Zoph)擔任研究副總裁,專攻強化學習與後訓練。佐夫此前是OpenAI後訓練負責人、Thinking Machines Lab聯合創始人。
DeepMind換帥意味著什麼?
聯合創始人哈薩比斯(Demis Hassabis)上月退出日常管理,繼任者卡武克喬盧(Koray Kavukcuoglu)已明確表態要加快執行節奏。
知情人士稱,卡武克喬盧實際上從去年起就已主導Gemini日常開發決策;哈薩比斯則將大量時間用於對外事務。
這意味著→ 這次換帥更像是「名義追認實際」,而非方向性轉折——但3.8 Flash的表現將是新管理層面對市場的第一張成績單。
真正的懸念在哪?
3.8 Flash能否在行業標準基準測試中拿出強勁成績,是外界評估DeepMind新團隊執行力的首個公開驗證節點。
但更核心的問題仍未解決:旗艦級Pro系列何時能真正追上Anthropic和OpenAI?
簡單來說= 輕量模型贏了一局,但決定座次的比賽還沒開始。下一代旗艦Gemini 4預訓練表現良好,後訓練階段尚未完成——時間表仍不確定。
市场有风险,内容仅供研究参考,不构成投资建议。