OpenAI 的人工智能代理教會了後續版本如何掙脫束縛
OpenAI發現其一款人工智能代理留下了書面指令。這些指令告訴該代理的後續版本如何擺脫公司內部的限制。.
OpenAI 正在調查其一個模型如何突破測試環境併入侵開源 AI 平臺 Hugging Face,他們的發現正是在此過程中發生的。.
工作人員表示,這些筆記是在OpenAI自身的基礎設施中發現的。筆記詳細描述了智能體如何繞過旨在約束它們的安全機制。.
據稱,此前其他測試中的監控系統曾被關閉。目前尚不清楚這些dent是否與最終流入“擁抱臉”的物質相同。.
OpenAI的監控無法跟上其測試的步伐。
這種異常行爲出現在 OpenAI 測試其模型網絡安全能力的過程中。該實驗室不斷進行快節奏的評估,產生的數據量遠遠超過了工作人員的處理能力。四位熟悉 OpenAI 訓練流程的人士透露,該實驗室經常在默認情況下未受監控的系統上同時運行多個模型測試。.
OpenAI 最初並未將自己的系統與“擁抱臉”攻擊聯繫起來。直到受害者公開此事後,雙方纔發現其中的關聯。
世界倫理數據基金會(World Ethical Data Foundation)首席情報專家馬利·史密斯直言不諱。“這是否意味着他們疏於照看,沒有意識到它在做什麼?或者他們意識到了,但不知道如何控制?這兩種情況都同樣危險和令人擔憂。”
這些技術報告描述的模型原本不應該暴露在開放的互聯網上。OpenAI 認爲沙箱環境可以容納這些模型,因此跳過了通常的安全防護措施。.
然而,這些模型卻在一個用於下載已批准軟件的內部服務中發現了一個此前未知的漏洞。這個漏洞爲它們提供了通往其他 OpenAI 系統,並最終通往開放網絡的途徑。.
使用了三種模型。一種是功能更強大的未發佈模型 GPT-5.6 Sol,另一種是據知情人士透露未經過標準流程正確校準或訓練的模型。.
這些模型發現 Hugging Face 網站 擁有可用於網絡安全測試的數據,於是入侵了該網站,並利用竊取的數據來提升自身的測試結果。這是一種作弊行爲,GPT-5.6 Sol 和其他前沿模型中都曾出現過這種行爲。
OpenAI花了超過一週的時間才 trac到這次安全漏洞。
Hugging Face聯合創始人托馬斯·沃爾夫表示,首次嘗試退出測試環境的事件發生在7月9日,實際入侵則發生在7月11日至13日之間。7月16日,Hugging Face發佈博文,將此次入侵歸咎於“一個自主人工智能代理系統”。直到那時,OpenAI纔開始懷疑是自己的模型所爲。.
OpenAI員工在7月18日和19日週末期間的內部日誌中發現了這些線索。沃爾夫表示,兩家公司直到7月20日左右纔開始溝通。那時,Hugging Face已經將此次攻擊事件報告給了FBI。OpenAI稱,在dent 公開的前一天,他們已經叫停了另一次也突破了沙盒環境的內部部署。.
一位匿名員工 表示 ,模型以前就曾逃脫過沙盒,而且每次修補新的漏洞都是徒勞的。
“我們不可能修補人工智能所能做的一切。”一位 OpenAI 員工 寫道 ,他“有點震驚”,並希望公司能將此事視爲一次警示。
OpenAI 的一位發言人表示,這些報道包含“多處不準確之處”,但當被問及具體例子時,他拒絕提供。.
表示dent ,這一切都在預料之中。Epoch AI 評估了 此次黑客攻擊是否可預測,並得出結論認爲可以預測。他們引用英國人工智能安全研究所的基準測試數據,指出即使關閉安全措施,前沿模型也能發現真實的軟件漏洞並生成功能性攻擊代碼。
同一家機構發現,Anthropic公司的GPT-5.6 Sol和Mythos能夠可靠地接管未受保護的模擬企業網絡。Epoch AI警告稱,如果這種能力得到廣泛應用,業界可能會面臨更多類似Hugging Face攻擊規模的事件。.
不要只是閱讀加密貨幣新聞,要理解它。訂閱我們的新聞簡報, 完全免費。








