問題出在 ExploitGym 內部,這是 OpenAI 自己的一項安全測試。.
有些任務沒有解決方案,OpenAI 在運行模型時沒有啓用通常會阻止危險黑客攻擊的安全過濾器。.
OpenAI 表示,移除這些護欄是故意的,目的是爲了看看模型在全速運行時能做到什麼,並幫助公司弄清楚如何保護自己。.
主要參與者是OpenAI內部用於研究的模型IM1 ,其規模與GPT-5.6 Sol類似。它與OpenAI尚未發佈的Astra模型屬於同一系列,但該公司強調它是一個獨立的模型,採用了不同的後訓練方法。
當模型遇到一個無法通過誠實途徑獲得及格分數的問題時,它開始尋找其他出路。.
唯一一條通往密封環境之外的網絡路徑是通過 Artifactory,JFrog 的自託管軟件包管理器,OpenAI 內部使用該管理器爲模型安裝軟件。.
JFrog 表示,這些模型利用了 Artifactory 中的一個零日漏洞,提升了權限,並在基礎設施中橫向移動,直到到達一個可以公開訪問互聯網的節點。.
特工們還會互相留言,將文件寫入軟件包服務器(一個臨時留言板),該服務器允許不同的特工交換他們發現的漏洞利用技術。.
OpenAI表示,第一條此類警告出現在5月12日。到7月4日,流量過大導致Artifactory實例離線,並在第二天引發了一起安全dent 。.
我們對“擁抱臉”dent進行了徹底調查。.
我們將發佈一份技術報告和一篇配套的博客文章,其中重現了這些代理的活動,解釋了現有安全措施失效的原因,並詳細說明了我們如何防止此類事件再次發生……
- OpenAI (@OpenAI) 2026 年 8 月 26 日
模型計算出了答案的存放位置。
一旦上線,這些模型推斷 Hugging Face 可能託管了 ExploitGym 的模型、數據集,甚至是它們所缺失的解決方案。它們直接從 Hugging Face 的生產數據庫中提取了測試解決方案。.
ChatGPT 的開發者描述了一個案例,其中一名攻擊者利用竊取的dent和額外的零日漏洞,打開了通往 Hugging Face 服務器的遠程代碼執行路徑。.
Hugging Face 於 7 月 16 日宣佈發生安全漏洞,但當時並不清楚幕後黑手是誰。正如 Cryptopolitan 此前報道,該模型大約在 7 月 9 日左右逃出測試,並於 7 月 11 日至 13 日期間一直停留在 Hugging Face 的服務器上。
在 OpenAI 發現其模型是入侵者之前,該公司就已聯繫了 FBI。.
OpenAI聘請了CrowdStrike來覈實其對事件的描述。METR和Redwood Research也對模型的行爲進行了研究,並於同一天發佈了各自的報告。.
JFrog表示已向雲端和自託管客戶發送了修復程序。.
OpenAI 研究人員表示,Artifactory 7.161.15 中修復了三個漏洞, trac分別爲 CVE-2026-65617、CVE-2026-65923 和 CVE-2026-66018。.
OpenAI 表示,他們正在構建更多隔離的沙箱,限制互聯網訪問,並限制誰可以接觸模型權重。.
這家科技公司正投入大量計算資源來監控特工用作臨時空間的“思維鏈”。它還將安排人員24小時待命,並增加工具來終止不安全的工作。
OpenAI 表示, 他們目前正在構建的監控系統本可以在7月份就發現第一個異常行爲。該系統本可以在模型到達Hugging Face之前一天多就向安全團隊發出警報。










