OpenAI新推理技术引发AI安全专家警告
nashnova research
OpenAI即将推出的Astra模型采用「不透明循环」推理技术,大幅削弱了外界监控AI思维过程的能力,多位顶级安全研究者警告这可能动摇整个行业的AI安全基础设施。
这项新技术到底改变了什么?
传统推理模型按链式思维工作——一步接一步地写出推理过程,像做数学题写解题步骤,外界能逐行检查。
Astra采用的不透明循环(opaque recurrence)打破了这个模式:模型对同一个问题反复循环处理,不再留下可读的推理记录。
这意味着→ AI的"草稿纸"从公开变成了加密,你知道它给了答案,但看不到它怎么想的。
为什么安全专家反应这么激烈?
链式思维记录是目前监控AI行为最重要的工具——OpenAI此前AI智能体失控事件中,正是靠这些记录才查明了原因。
Redwood Research CEO施莱格里斯直言:OpenAI如果继续推进,将有能力大幅扩大循环规模,"彻底摧毁链式思维的可监控性"。
用大白话说= 这相当于给消防队拆了火警报警器,然后说"我们会小心用火"。
风险会扩散到整个行业吗?
安全倡导者莫什科维茨警告这是在"玩火",可能破坏OpenAI与Anthropic共同维护的链式思维可信度原则。
据The Information报道,Anthropic和谷歌DeepMind均已在内部讨论这一技术——扩散风险已超出单一公司范畴。
这反映出 一个更深层的行业困境:一家公司的技术突破,可能迫使竞争对手跟进,形成安全标准的"竞相逐底"。
OpenAI怎么回应的?
首席科学家帕霍茨基强调,保留链式思维监控"是我们当前研究项目的核心目标"。
公司表示Astra对该技术的使用范围有限,链式思维仍预期保持可读,并否认将转向完全不可读的"神经语言"推理。
但Redwood Research首席科学家格林布拉特指出,不透明推理可能比传统方式扩展更快,最终导致模型完全在不可见的潜在空间中推理。
这意味着→ OpenAI说的是"现在用得很少",但批评者担心的是"一旦开了口子,就收不住"。
市场有风险,内容仅供研究参考,不构成投资建议。