Claude助攻攻破OpenAI,AI渗透成本不足3000美元
nashnova research
三人安全团队用Anthropic的Claude Opus 5,不到72小时攻入OpenAI内部代码仓库,Token总成本不到3000美元——这意味着→ AI正在把过去只有国家级黑客才玩得转的渗透能力,拉到任何人月付200美元就能上手的水平。
他们到底是怎么从一张图片打进核心代码库的?
攻击起点是OpenAI社区论坛的图片上传功能:用户上传HEIC格式图片时,解析库libheif(一个处理苹果手机常用图片格式的底层组件)存在堆缓冲区溢出漏洞。
这意味着→ 攻击者只需上传一张精心构造的图片,就能在OpenAI的服务器上远程执行任意代码。
关键在于:这个漏洞的修复补丁一年前就已完成,但因为没被标记为安全问题、也没分配CVE编号,OpenAI论坛使用的Docker镜像始终没打上补丁。
用大白话说= 补丁写好了但没人知道该装它,这张图片就是从这个缝隙钻进去的。
拿到论坛权限之后,怎么一路升级到员工账号?
第二个漏洞在OpenAI的单点登录(SSO)(一个账号通一切服务的登录系统):攻击者利用论坛服务器上的代码执行权限,结合SSO身份验证缺陷,直接接管了曾登录论坛的用户账号,包括OpenAI员工。
这些员工账号已关联Outlook、Gmail、Google Drive、Slack、GitHub等外部服务——这意味着→ 攻击面远超ChatGPT本身,一个入口撬开整片生态。
为证明攻击真实同时不碰敏感数据,团队选了一个已连接OpenAI GitHub组织的员工账号,通过其Codex向内部单体代码仓库提交了一个无害PR(#1186742)。
团队特别强调:SSO漏洞不是Discourse特有的,任何使用OpenAI SSO的服务被攻破,都会导致同样的账号接管。
Claude Opus 5到底比上一代强在哪?
团队先用Opus 4.8审查Docker镜像,成功发现了未回移的安全修复,也造出了部分可用的攻击代码——但在开启ASLR(地址空间布局随机化,一种打乱内存地址的防御机制)的真实环境下,多轮尝试都无法稳定利用。
Opus 5发布后数小时内,同样的问题交给它,3小时产出可用攻击代码,先搞定ARM64架构,再移植到x86-64环境。
用大白话说= 4.8知道洞在哪但造不出能用的武器,5直接造出来了——这是从"发现漏洞"到"写出实战攻击代码"的质变。
为绕过Opus 5拒绝攻击真实服务器的安全限制,团队通过代理把目标伪装成夺旗赛(CTF)靶机域名——这反映出当前模型安全护栏的脆弱性。
3000美元和两个月意味着什么?
整个项目历时约两个月,三人完成全部工作,大模型Token总成本不到3000美元;将攻击代码适配到每个新目标通常只需一两天。
这意味着→ 过去需要大型团队数月研发的渗透能力,现在三个人加一张信用卡就能复现。
后续调查显示,libheif同一漏洞还影响了Slack、Meta、GitHub Enterprise、Ruby on Rails及多个Node.js框架——除Shopify外,没有任何一家公司检测到攻击活动,即使攻击者发送了数千张图片并多次导致进程崩溃。
Gray Swan CEO弗雷德里克森的原话:"每月200美元,任何人都能用这些工具黑进OpenAI这样的公司。"
监管和模型能力之间的时间差有多大?
破解漏洞的Claude Opus 5目前尚未面临安全出口限制;而更新版本Mythos 5因高级黑客能力引发担忧,已被临时锁定。
这反映出监管节奏与模型能力演进之间的错位:能力已经部署到实战,限制才刚开始讨论。
开源端同样在追赶:SaferAI发现中国Z.ai公司的GLM-5.2在网络攻击能力上仅落后GPT-5.5和Opus 4.7数月。
用大白话说= 软件行业长期依赖的"复杂性即安全"正在失效——过去黑客攻击需要的稀缺专业知识,正在被AI工具快速拉平,这个窗口收窄的速度,决定了现有安全框架还能撑多久。
OpenAI和Discourse怎么回应的?
OpenAI在报告提交后约14小时修复了SSO问题,9月1日向团队结算6500美元赏金,注明奖励针对SSO发现——论坛渗透测试本身不在赏金计划范围内。
Discourse周六收到报告、周日回复、周一准备好补丁并开始对ImageMagick进行沙箱隔离,7月28日发布安全公告GHSA-vhm9-85gw-x335。
团队还发现,在对完全未知目标环境盲打时,GPT-5.6 Sol展现出比Opus 5更强的适应能力——这意味着→ 模型间的能力竞赛正在安全攻防领域同步上演。
市场有风险,内容仅供研究参考,不构成投资建议。
