Anthropic风险报告:AI误对齐风险上调,内部Model 2暂不对外发布

Nashnova编辑部
Published todayAbout 3 min read

Anthropic首次将AI误对齐风险从「极低」上调至「低」,同时披露一款内部模型Model 2暂不发布——评估工具正在失效,公司对自身模型能力边界的掌握出现盲区。

01

风险评级上调,到底调了什么?

Anthropic将高风险场景下AI误对齐(misalignment,即AI的行为偏离人类意图)的整体风险从「极低」上调至「低」,触发因素是近期出现的网络安全事件。
这意味着→ 虽然「低」听起来不严重,但这是Anthropic迄今公开承认的最高风险等级——公司对自家模型可能造成危害的判断正变得更保守。
用大白话说= Anthropic以前觉得"出大问题的概率几乎为零",现在改口说"概率不大但不能忽略"。
02

Model 2是什么?为什么不发布?

报告披露了一款内部代号「Model 2」的未发布模型,在编程、智能体工作和数据生成等内部任务上表现出「明显提升」,已被员工大量使用。
但Anthropic明确表示:「我们目前没有对外发布该模型的计划。」
这反映出 公司正在"先用后放"——内部已经在跑更强的模型,但对外发布的门槛在收紧,安全顾虑压过了商业化冲动。
03

评估工具失效意味着什么?

Model 2的性能跃升幅度不及此前从Opus 4.6升级至Mythos时的提升,但Anthropic对自身评估的信心反而更低了。
报告原话:「我们最具体的基于任务的评估……已无法再捕捉到模型能力的提升。」
这意味着→ 不是模型变弱了,而是量尺不够长了——现有测试已经触顶,Anthropic无法准确知道自己的模型到底有多强,这才是最让人不安的信号。
04

自动化研发能力加速,双刃剑怎么理解?

Anthropic观察到模型在自动化研究与开发方面的能力正在加速提升。
用大白话说= AI越来越能"自己搞研发"——既能加速技术进步,也意味着一旦被滥用,造成的破坏也会更快、更难预料。
05

行业在减速,Anthropic为什么没跟?

OpenAI因无法排除旗下即将发布的Astra模型存在关键网络攻击能力,已选择放缓发布节奏
AI分析师ChrisGPT向Axios表示:「如果其他所有人都在放缓,而处于领先位置的主要公司之一却不承诺内部暂停,那将极为引人注目……Anthropic不承诺内部暂停,很可能使其率先达到AGI。」
Anthropic目前未宣布任何内部暂停计划。这反映出 在安全与竞争之间,Anthropic选择了一条微妙的中间路线——上调风险评级以示审慎,但并不停下脚步。

Content is for reference only, not financial advice.

Anthropic风险报告:AI误对齐风险上调,内部Model 2暂不对外发布 · nashnova