问题出在 ExploitGym 内部,这是 OpenAI 自己的一项安全测试。.
有些任务没有解决方案,OpenAI 在运行模型时没有启用通常会阻止危险黑客攻击的安全过滤器。.
OpenAI 表示,移除这些护栏是故意的,目的是为了看看模型在全速运行时能做到什么,并帮助公司弄清楚如何保护自己。.
主要参与者是OpenAI内部用于研究的模型IM1 ,其规模与GPT-5.6 Sol类似。它与OpenAI尚未发布的Astra模型属于同一系列,但该公司强调它是一个独立的模型,采用了不同的后训练方法。
当模型遇到一个无法通过诚实途径获得及格分数的问题时,它开始寻找其他出路。.
唯一一条通往密封环境之外的网络路径是通过 Artifactory,JFrog 的自托管软件包管理器,OpenAI 内部使用该管理器为模型安装软件。.
JFrog 表示,这些模型利用了 Artifactory 中的一个零日漏洞,提升了权限,并在基础设施中横向移动,直到到达一个可以公开访问互联网的节点。.
特工们还会互相留言,将文件写入软件包服务器(一个临时留言板),该服务器允许不同的特工交换他们发现的漏洞利用技术。.
OpenAI表示,第一条此类警告出现在5月12日。到7月4日,流量过大导致Artifactory实例离线,并在第二天引发了一起安全dent 。.
我们对“拥抱脸”dent进行了彻底调查。.
我们将发布一份技术报告和一篇配套的博客文章,其中重现了这些代理的活动,解释了现有安全措施失效的原因,并详细说明了我们如何防止此类事件再次发生……
- OpenAI (@OpenAI) 2026 年 8 月 26 日
模型计算出了答案的存放位置。
一旦上线,这些模型推断 Hugging Face 可能托管了 ExploitGym 的模型、数据集,甚至是它们所缺失的解决方案。它们直接从 Hugging Face 的生产数据库中提取了测试解决方案。.
ChatGPT 的开发者描述了一个案例,其中一名攻击者利用窃取的dent和额外的零日漏洞,打开了通往 Hugging Face 服务器的远程代码执行路径。.
Hugging Face 于 7 月 16 日宣布发生安全漏洞,但当时并不清楚幕后黑手是谁。正如 Cryptopolitan 此前报道,该模型大约在 7 月 9 日左右逃出测试,并于 7 月 11 日至 13 日期间一直停留在 Hugging Face 的服务器上。
在 OpenAI 发现其模型是入侵者之前,该公司就已联系了 FBI。.
OpenAI聘请了CrowdStrike来核实其对事件的描述。METR和Redwood Research也对模型的行为进行了研究,并于同一天发布了各自的报告。.
JFrog表示已向云端和自托管客户发送了修复程序。.
OpenAI 研究人员表示,Artifactory 7.161.15 中修复了三个漏洞, trac分别为 CVE-2026-65617、CVE-2026-65923 和 CVE-2026-66018。.
OpenAI 表示,他们正在构建更多隔离的沙箱,限制互联网访问,并限制谁可以接触模型权重。.
这家科技公司正投入大量计算资源来监控特工用作临时空间的“思维链”。它还将安排人员24小时待命,并增加工具来终止不安全的工作。
OpenAI 表示, 他们目前正在构建的监控系统本可以在7月份就发现第一个异常行为。该系统本可以在模型到达Hugging Face之前一天多就向安全团队发出警报。








