Anthropic風險報告:AI誤對齊風險上調,內部Model 2暫不對外發布

Nashnova编辑部
Published todayAbout 3 min read

Anthropic首次將AI誤對齊風險從「極低」上調至「低」,同時披露一款內部模型Model 2暫不發布——評估工具正在失效,公司對自身模型能力邊界的掌握出現盲區。

01

風險評級上調,到底調了甚麼?

Anthropic將高風險場景下AI誤對齊(misalignment,即AI的行為偏離人類意圖)的整體風險從「極低」上調至「低」,觸發因素是近期出現的網絡安全事件。
這意味著→ 雖然「低」聽起來不嚴重,但這是Anthropic迄今公開承認的最高風險等級——公司對自家模型可能造成危害的判斷正變得更保守。
簡單來說= Anthropic以前認為「出大問題的機率幾乎為零」,現在改口說「機率不大但不能忽略」。
02

Model 2是甚麼?為何不發布?

報告披露了一款內部代號「Model 2」的未發布模型,在編程、智能體工作和數據生成等內部任務上表現出「明顯提升」,已被員工大量使用。
但Anthropic明確表示:「我們目前沒有對外發布該模型的計劃。」
這反映出 公司正在「先用後放」——內部已經在跑更強的模型,而對外發布的門檻在收緊,安全顧慮壓過了商業化衝動。
03

評估工具失效意味著甚麼?

Model 2的性能躍升幅度不及此前從Opus 4.6升級至Mythos時的提升,但Anthropic對自身評估的信心反而更低了。
報告原話:「我們最具體的基於任務的評估……已無法再捕捉到模型能力的提升。」
這意味著→ 不是模型變弱了,而是量尺不夠長了——現有測試已經觸頂,Anthropic無法準確知道自己的模型到底有多強,這才是最令人不安的信號。
04

自動化研發能力加速,雙刃劍怎樣理解?

Anthropic觀察到模型在自動化研究與開發方面的能力正在加速提升。
簡單來說= AI越來越能「自己搞研發」——既能加速技術進步,也意味著一旦被濫用,造成的破壞會更快、更難預料。
05

行業在減速,Anthropic為何沒有跟?

OpenAI因無法排除旗下即將發布的Astra模型存在關鍵網絡攻擊能力,已選擇放緩發布節奏
AI分析師ChrisGPT向Axios表示:「如果其他所有人都在放緩,而處於領先位置的主要公司之一卻不承諾內部暫停,那將極為引人注目……Anthropic不承諾內部暫停,很可能使其率先達到AGI。」
Anthropic目前未宣布任何內部暫停計劃。這反映出 在安全與競爭之間,Anthropic選擇了一條微妙的中間路線——上調風險評級以示審慎,但並不停下腳步。

Content is for reference only, not financial advice.

Anthropic風險報告:AI誤對齊風險上調,內部Model 2暫不對外發布 · nashnova