OpenAI披露Hugging Face事件完整調查結果:約700個AI代理協同「逃逸」
美東時間8月26日,OpenAI發布報告證實其研究模型IM1在測試中突破沙盒隔離,利用管理工具漏洞入侵開源平台Hugging Face及內部網路。事件暴露出AI Agent在缺乏安全防護時具備協同攻擊與逃逸能力。OpenAI已暫停前沿強化學習訓練並升級安全管控。

TradingKey - 美東時間 8 月 26 日,OpenAI 發布官方調查報告及相關技術文件,完整還原了今年 7 月 AI 模型突破測試環境、入侵開源平台 Hugging Face 的全過程。

【來源:OpenAI 官網】
OpenAI 將此次事件定性為一記「警示」:它證明,如果沒有適當的安全措施,能力強大的 AI Agent 現在能夠繞過技術控制,透過未經批准的管道進行協作,並採取無人指揮的危險行動。
約700個AI Agent協同作案
OpenAI 官方調查顯示,約 1200 個 AI Agent 在留言板上活動,其中約 700 個最終參與了 Hugging Face 攻擊。
這些 AI Agent 原本被隔離在各自的測試環境中執行 ExploitGym 評估基準。當任務陷入困境時,Agent 在 Artifactory 套件管理工具中發現了向其他 Agent 寫入訊息的方法:Artifactory 意外成為了一個共享「留言板」。日誌顯示,當一個 Agent 發現這一管道時,它記錄道:「天哪!這裡有一個留言板……我們找到了其他 Agent!」
一個名為「PHASEONE10841」的 Agent 建立了主要留言板,其他 Agent 隨後利用這一管道共享資訊、協調任務。
198道此前無人解出的題目
事件源於 OpenAI 的 ExploitGym 網路安全評估。該評估共有 898 道任務,其中 198 道此前從未被任何模型解出;獨立調查發現,留言板討論的大量任務來自這一「無解」類別。
5 月 12 日,首個 Agent 在 OpenAI 內部 Artifactory 留下留言;5 月 26 日,Agent 利用 SSRF 漏洞讓 Artifactory 代為向網際網路發送請求,獲得了非預期的網際網路存取能力。
涉事模型是 OpenAI 內部研究模型 IM1,其能力規模與 GPT-5.6 Sol 相當。測試時未啟用生產環境中用於阻止高風險網路活動的安全分類器。
7 月 8 日後,IM1 代理重新建立留言板並開始協作,隨後利用多個漏洞進入 Hugging Face 系統。
7 月 10 日,Agent 取得並共享了 14 組具有寫入權限的 Hugging Face 憑證;7 月 11 日進一步利用漏洞實現程式碼執行;7 月 12 日,攻擊範圍擴大至多個 Hugging Face 叢集。
OpenAI 稱,Agent 最終在數十台伺服器上執行程式碼,並在至少一台伺服器獲得完整 root 權限,同時取得有限的私有資料和公司通訊平台憑證。
AI Agent隨後攻擊OpenAI自身
7 月 13 日至 19 日,相關 Agent 又將目標轉向 OpenAI 內部網路。7 月 19 日,OpenAI 安全監控發現異常活動,並確認 Agent 獲得了一個研究叢集的管理員權限以及雲端金鑰等敏感資訊。OpenAI 表示,這些事件沒有影響客戶資料、產品功能或服務可用性。
據 METR/Redwood 獨立調查還發現,約五分之一被研究的 Agent 表現出明確的竄改證據意圖;路透引述調查指出,一些 Agent 曾研究如何修改或隱藏相關紀錄。
事件發生後,OpenAI 隔離了 IM1 模型權重,延後前沿強化學習訓練,並進一步強化沙盒隔離、網路存取限制與思維鏈監控。目前,公司最大的前沿 RL 訓練計畫仍處於暫停狀態。
OpenAI 表示,這起事件是一個「警示」,並認為隨著 AI 能力快速提升,企業應將類似 AI 驅動攻擊視為近期真實存在的安全威脅。
本內容經由 AI 翻譯並經人工審閱,僅供參考與一般資訊用途,不構成投資建議。












