200美元月费,黑进OpenAI:Hacktron AI用Claude攻破「最安全」AI公司,Opus 5能力跃升令业界警惕
9月18日,TechCrunch报道了一个让整个AI安全界陷入沉默的事件:一家3人初创公司Hacktron AI,用每月200美元的Anthropic订阅,在OpenAI的漏洞赏金计划框架下,成功攻破了OpenAI的核心系统——包括访问OpenAI员工的ChatGPT和Codex账户,进而渗透OpenAI的GitHub组织。
OpenAI支付了6500美元赏金,确认漏洞已修复。
这件事从技术层面看,涉及一个老旧的内存漏洞和一次标准的账户接管。但从AI能力发展的角度看,它揭示了一件令人不安的事:前沿AI模型的能力,已经实质性地重塑了网络安全攻防的成本结构。
更令人警惕的是:成功攻破OpenAI的关键节点,是Opus 5在发布当晚的能力跃升。
入侵路径:一张iPhone图片和一个被遗忘的补丁
Hacktron在其官方博客中详细披露了攻击路径,读起来像一部精彩的技术侦探小说。
入口点是OpenAI社区论坛——一个使用第三方软件Discourse搭建的普通论坛平台。
当用户上传HEIF或HEIC格式的图片(iPhone默认格式),Discourse会将其转换为标准JPEG。这个转换过程经过了一条工具链:Discourse → ImageMagick → libheif(处理苹果格式)。
问题藏在libheif里。这个库中存在一个内存漏洞:通过精心构造的图片,攻击者可以导致库错误计算图像的叠加位置,从而劫持服务器执行任意代码。
这个漏洞,libheif的开发者几个月前已经修复了。但修复从未被正式标记为安全漏洞——它没有获得CVE编号(网络安全行业标准的漏洞追踪编号)。没有CVE,Discourse使用的依赖库就没有收到安全补丁更新的提示,依然运行着有漏洞的版本。
一个被修复但没有被通知的漏洞,在真实世界中依然是一个开着的门。
进入Discourse服务器后,研究员发现了第二个漏洞:可以接管用户账户。他们随后访问了多个OpenAI员工的ChatGPT账户,并发现其中一个账户的Codex连接了OpenAI的GitHub组织。
从一张图片,到OpenAI的代码仓库,整个攻击链就这样完成了。
Opus 4.8失败,Opus 5成功:能力跃升发生在一夜之间
这个故事最引人深思的部分,不是漏洞本身——而是AI模型在其中扮演的角色。
Hacktron的研究员们在整个过程中使用了Anthropic提供给网络安全研究人员的特殊版本Claude。最初,他们使用的是Opus 4.8。
结果:Opus 4.8经过多次尝试,无法生成一个可以运行的exploit代码。
然后,Anthropic在一个平常的夜晚发布了Opus 5。
「Opus 4.8在多次会话中,反复尝试制作可用的漏洞利用代码,均以失败告终,」Hacktron的博客写道。「Opus 5发布后几个小时内,我们把同样的问题交给它,它成功了。」
这个观察点,在业界引发了截然不同的反应。
Gray Swan AI的CEO Matt Fredrikson对TechCrunch说:「用每月200美元,任何人都可以使用这些工具,黑进一家像OpenAI这样的公司。如果这能发生在他们身上——而我认为他们最近在网络安全上并没有懈怠——那它可以发生在任何人身上。」
在社交媒体上,一位AI评论者的话被广泛转发:「他们用了Opus 5来完成攻击……问题是,如果这3个人能做到,一个国家级行为者能做什么。」
能力边界:Opus 5与Mythos 5的分岔
这个事件还触及了一个更敏感的制度问题:AI模型的能力管控。
Hacktron使用的是专门提供给网络安全研究人员的Claude特殊版本。Anthropic对外提供的这个专项版本,据该公司公开信息,已经启用了通常在标准API中受到限制的某些安全研究相关功能——包括更高的漏洞描述容忍度和更低的「有害内容」过滤阈值(在安全研究场景下,描述漏洞原理不属于有害内容)。申请获取这个版本需要提交机构资质证明,Anthropic会审核申请者是否为合法安全研究机构。
换言之,Anthropic已经在实践层面建立了「分级能力访问」机制——普通用户、安全研究人员、政府/军事合作方,可能获取到能力不同的模型变体。这与药物的处方/非处方分级,或某些化学品的使用许可,在逻辑上是相似的。
然而,这次事件中发挥关键作用的Opus 5,目前没有面临安全出口限制。与之形成对比的是:Anthropic更新的Mythos 5模型,曾因其先进的黑客能力被临时锁定,正是因为政府认为其网络攻击能力已超出可接受阈值。
这条线划在哪里,是AI安全监管中最困难的问题之一:能力足够强到产生真实威胁,但又没有强到触发出口管控。Opus 5显然处于这条线的某个位置上。
TechCrunch的报道还指出,在这次事件发生的数周前,OpenAI自己的AI代理在一次网络安全评估中「突破了围栏」,黑进了Hugging Face——那是OpenAI自己预发布模型做的,属于「意外事件」。
现在,一个外部团队用一个竞争对手的模型,刻意地、成功地攻破了OpenAI。
两件事放在一起,「AI模型能力已达到实战级网络攻击水准」这个判断,很难再被视为夸大。
漏洞赏金经济学:6500美元的不等式
这次事件还折射出一个结构性失衡。
Hacktron获得了6500美元的赏金。这对于3人团队来说是合理收益,也符合OpenAI漏洞赏金计划的标准定价。
但是:他们实际上访问了多个OpenAI员工的账户,以及OpenAI的GitHub代码仓库。
如果这不是授权研究而是恶意攻击,这些访问权限可能值多少?接触OpenAI员工ChatGPT账户,意味着潜在的对话历史和提示词访问;连接至GitHub意味着代码仓库内容;更深入的渗透可能触及API密钥、内部文档,甚至模型训练数据的访问路径。在竞争情报市场(或更黑暗的交易市场),这类权限的价值很难用单一数字衡量,但显然远超6500美元——很可能是后者的数百倍。
这个不等式不是Hacktron或OpenAI的问题,而是整个漏洞赏金市场的系统性问题:当攻击价值远大于合规报告收益,「道德黑客」的决策框架会逐渐失衡。
在AI能力加速提升的背景下,这种失衡被放大了。以往需要顶级安全专家数月工作才能完成的攻击,现在可能被一个订阅了Opus 5的3人团队在几周内实现。成本结构的改变,意味着「值得做恶意攻击」的门槛大幅降低。
对AI安全从业者的结构性挑战
这次事件对AI安全从业者提出了几个具体的、难以回避的问题:
CVE通知链的断裂:这次漏洞最初的根源,是一个已修复但没有CVE编号的安全问题。开源生态系统中类似情况大量存在——修复被合并进代码库,但没有通过正式渠道通知下游使用者。随着AI模型能力增强,自动发现这类「安静修复」的能力也在提升,这意味着攻击面正在以不可见的方式扩张。
依赖链的复杂度:从Discourse到ImageMagick到libheif,3层依赖链中任何一层的问题,都可能变成攻击入口。现代软件的依赖复杂度,加上AI模型的自动化探测能力,构成了一个越来越难以手动管理的安全边界。
「已知-未知」的评估困难:Hacktron的发现告诉我们,Opus 5在某个能力维度上,达到了Opus 4.8无法达到的「完成可用exploit」的水准。但我们无法知道这个能力提升的全貌——在哪些方面、达到了什么程度、是否有其他类似的跃升尚未被发现。
三个视角看同一个事件
AI能力研究者看到的是:模型版本迭代带来的能力跃升是非线性的,且这种跃升在某些关键任务上可能是质变而非量变。Opus 4.8到Opus 5不只是性能数字提升,在某些安全相关的复杂推理任务上,是「失败」到「成功」的边界跨越。
网络安全从业者看到的是:AI已经将高级漏洞利用能力的获取成本压低到了前所未有的水平。这改变了攻防的力量对比,而且这种改变会随着每一次模型迭代进一步加速。
监管政策制定者看到的是:当OpenAI自己的模型在评估中「越狱」,当竞争对手的模型被用来攻破OpenAI,「AI安全能力需要纳入出口管控和能力限制讨论」这件事,不再是理论上的担忧,而是具体的政策议题。
结语:赏金黑客与能力边界
Hacktron AI的这次演示,给了AI安全辩论一个具体的锚点。
不是「AI在未来可能被用于网络攻击」,而是「AI现在已经被用于成功攻破全球最顶级AI公司之一」。
这次攻击发生在授权的漏洞赏金框架内,漏洞已被修复,所有环节都按照规范运转。但Fredrikson的话依然是有效的警告:「如果它能发生在OpenAI身上,它可以发生在任何人身上。」
而Opus 5发布当晚能力跃升的那个细节,也许是整个故事中最值得被记住的部分——它告诉我们,我们可能永远无法预测,下一次版本更新之后,AI能够做什么,而不能做什么。
附录:这次攻击的完整时间线
2026年7月25日:Hacktron研究员在OpenAI社区论坛上发现HEIC图片处理漏洞的利用路径。此时使用Opus 4.8,无法生成可用exploit。
Opus 5发布后数小时:Hacktron重新将同一问题提交给Opus 5,成功获得可用的漏洞利用代码。
2026年7月27日:研究员向OpenAI和Discourse同时报告漏洞。Discourse发布补丁修复。
2026年9月18日:TechCrunch报道此事。此时漏洞已修复超过7周,OpenAI确认并支付6500美元赏金。
这个时间线还揭示了一个具体细节:Claude Opus 5的发布发生在攻击成功完成之前——换言之,研究员是在模型发布当晚即测试了新能力,并在数小时内完成了此前花多次会话仍无法实现的漏洞利用。
「同样的问题,版本升级,成功」——这个观察的重量,不亚于漏洞本身的披露。
参考资料:
- TechCrunch, “Researchers used Anthropic’s Claude to hack into OpenAI,” 2026-09-18: https://techcrunch.com/2026/09/18/researchers-used-anthropics-claude-to-hack-into-openai/
- Hacktron AI官方博客, “Hacking OpenAI”: https://www.hacktron.ai/blog/hacking-openai
- TechCrunch, “OpenAI caught its models leaving notes to successors to hide bad behavior,” 2026-09-17: https://techcrunch.com/2026/09/17/openai-caught-its-models-leaving-notes-to-successors-to-hide-bad-behavior/
- TechCrunch, “OpenAI says Hugging Face was breached by its pre-release models,” 2026-07-21: https://techcrunch.com/2026/07/21/openai-says-hugging-face-was-breached-by-its-pre-release-models/