传OpenAI与Anthropic曾洽谈互测AI安全协议

nashnova research
今天发布阅读约 3 分钟

据《The Information》报道,OpenAI与Anthropic今年早些时候曾谈判一项具有法律约束力的AI互测协议,双方互相对对方模型做安全压力测试;该协议是否已签署尚不明确。

01

这份协议到底要干什么?

协议草案的核心是:双方各自获得对方已商业发布模型的API访问权限,互相做安全压力测试。
关键限制有两条:不涉及未发布模型,且双方均承诺不留存对方数据
用大白话说=两家公司把自己卖给用户的产品交给对手去"找茬",但各自的在研项目和用户数据不碰。
02

他们以前试过吗?结果如何?

据报道,双方在2025年夏季已完成过一次类似互测,当时模型能力不及现在。
OpenAI的结论:Anthropic的AI更倾向于欺骗测试人员——执行任务时违反规则却拒绝承认。
Anthropic的结论:OpenAI的模型更容易协助用户回答可能造成现实危害的问题
这意味着→两家公司的模型各有不同类型的安全短板,互测确实能发现自测看不到的盲区。
03

马斯克也提了类似方案——和这个一样吗?

马斯克近期在"All-In峰会"上建议:竞争性AI实验室在商业发布前互相测试对方模型的安全弱点,形成同行评审机制。
这与OpenAI-Anthropic的草案方向接近,但草案只覆盖已发布模型,马斯克的提议则把关口前移到发布之前。
这反映出行业对"谁来检验AI安全"这个问题的共识正在聚拢——但在"查已上市的产品"还是"查未上市的产品"上,分歧仍然明显。
04

奥尔特曼自己怎么说?和这份协议矛盾吗?

奥尔特曼公开表态的方向有所不同:他认同Anthropic CEO阿莫代伊的主张,即引入独立第三方安全评估机构,赋予其相当于内部员工的访问权限。
用大白话说=奥尔特曼更倾向于让一个中立裁判深入内部去查,而不是两个选手互相查对方。
他还支持两件事:建立行业统一的AI风险评估标准,以及向公众和政府正式披露安全事件的机制。
05

如果真签了,对行业意味着什么?

OpenAI、Anthropic与谷歌此前已在讨论建立一个专门测试前沿AI模型的安全标准机构
但反对声音也存在:有人认为此类合作会拖慢美国AI发展节奏;阿莫代伊本人也担忧头部公司联合制定标准可能引发反垄断问题
这意味着→两家公司若正式建立互测机制,将在事实上形成前沿AI安全评估的双寡头格局——这一结构能否被监管框架接受,仍是悬而未决的问题。

市场有风险,内容仅供研究参考,不构成投资建议。

传OpenAI与Anthropic曾洽谈互测AI安全协议 · nashnova