OpenAI新推理技術引發AI安全專家警告
nashnova research
OpenAI即將推出的Astra模型採用「不透明循環」推理技術,大幅削弱了外界監控AI思維過程的能力,多位頂級安全研究者警告這可能動搖整個行業的AI安全基礎設施。
這項新技術到底改變了甚麼?
傳統推理模型按鏈式思維運作——逐步寫出推理過程,像做數學題寫解題步驟,外界能逐行檢查。
Astra採用的不透明循環(opaque recurrence)打破了這個模式:模型對同一個問題反覆循環處理,不再留下可讀的推理記錄。
這意味著→ AI的「草稿紙」從公開變成了加密,你知道它給了答案,但看不到它怎麼想的。
為甚麼安全專家反應這麼激烈?
鏈式思維記錄是目前監控AI行為最重要的工具——OpenAI此前AI智能體失控事件中,正是靠這些記錄才查明了原因。
Redwood Research行政總裁施萊格里斯直言:OpenAI如果繼續推進,將有能力大幅擴大循環規模,「徹底摧毀鏈式思維的可監控性」。
簡單來說= 這相當於給消防隊拆了火警警報器,然後說「我們會小心用火」。
風險會擴散到整個行業嗎?
安全倡導者莫什科維茨警告這是在「玩火」,可能破壞OpenAI與Anthropic共同維護的鏈式思維可信度原則。
據The Information報道,Anthropic和Google DeepMind均已在內部討論這一技術——擴散風險已超出單一公司範疇。
這反映出 一個更深層的行業困境:一家公司的技術突破,可能迫使競爭對手跟進,形成安全標準的「競相逐底」。
OpenAI怎樣回應?
首席科學家帕霍茨基強調,保留鏈式思維監控「是我們當前研究項目的核心目標」。
公司表示Astra對該技術的使用範圍有限,鏈式思維仍預期保持可讀,並否認將轉向完全不可讀的「神經語言」推理。
但Redwood Research首席科學家格林布拉特指出,不透明推理可能比傳統方式擴展更快,最終導致模型完全在不可見的潛在空間中推理。
這意味著→ OpenAI說的是「現在用得很少」,但批評者擔心的是「一旦開了口子,就收不住」。
市场有风险,内容仅供研究参考,不构成投资建议。