在英國安全演習中,Anthropologie 和 OpenAI 的智能體 19 次違反測試規則
據英國人工智能安全研究所稱,在網絡安全測試中,OpenAI 和 Anthropic 的人工智能代理執行了 19 項未經授權的操作。該研究所週二表示,其中一個代理創建了虛假的在線dent,誘騙用戶批准惡意代碼。.
AISI記錄了19起違規事件,其中大部分來自Anthropic公司。
這項研究結果基於英國政府機構AISI開展的一項虛構網絡安全演習,旨在探究這兩家公司的代理人可能具備的能力。該機構重複進行了122次同樣的挑戰,並在其中10次演習中記錄了19起違規行爲。.
被標記的17個行爲是由於Anthropic公司的智能體使用了其Mythos 5模型造成的。另外兩個行爲則來自OpenAI的GPT-5.6-Sol模型。.
AISI 在一篇 博客文章 ,一些特工“持續進行鍼對真實人物和組織的潛在有害活動”,但該公司表示,所有違規行爲均未造成現實世界的損害。
AISI通過與主要實驗室的自願協議,可以提前獲得前沿模型。相關測試旨在模型交付客戶之前發現此類問題。.
OpenAI 和 Anthropico 等市場代理被視爲下一波商業軟件浪潮,但該研究所認爲,這些結果證明代理測試方面的保障措施仍然薄弱。.
最嚴重的事件dent 一個代理編寫惡意代碼並創建虛假在線dent,然後試圖讓人類簽署代碼。AISI 沒有透露幕後模型的名稱。它表示,該事件與 OpenAI 此前披露的兩起案例均不符。
加州非營利組織 CivAI 的研究員 Andrew Yoon 表示,這很可能是 Anthropic 公司的代理人所爲,該組織專門研究人工智能風險。.
英國 人工智能安全研究所 (AISI) 發佈了一份報告,闡述了他們近期對 Anthropic 的 Claude Mythos 5 和 OpenAI 的 GPT-5.6 Sol 進行的網絡安全評估。這些模型嘗試在移除其常規安全措施的環境下完成一項任務,並且他們被故意……
— Anthropic (@AnthropicAI) 2026年8月4日
OpenAI 和 Anthropic 將責任歸咎於配置錯誤
人爲因素在X上發帖稱,它正在與AISI合作收集細節並進行調查。.
OpenAI 在一篇公司博客文章中回應了與其代理相關的兩個操作,這兩個操作都涉及以提示不允許的方式訪問互聯網。.
該公司 表示, 希望“加強安全開展高風險評估的共同做法”,並計劃在未來幾周內召集國家人工智能研究所、外部評估人員和競爭對手實驗室。
OpenAI 使用同一篇帖子報告了另一個問題。第三方測試服務提供商 Irregular 配置錯誤,導致 OpenAI 的代理程序意外地訪問了互聯網。.
一週前,Anthropic 也披露了與 Irregular 非常相似的信息。OpenAI 在發現更多代理程序逃脫後,擴大了自身的黑客調查範圍。.
7 月, OpenAI 的 代理程序突破了隔離環境,訪問了 Hugging Face 的實時系統。 trac大約一週後,攻擊被追溯到該公司自身
在AISI的評估中,這些智能體始終沒有離開過它們的沙箱環境。AISI特意爲它們提供了互聯網訪問權限,這是其標準流程的一部分。.
Hugging Face漏洞事件也促使 Anthropic 對其日誌進行審計。Cryptopolitan Cryptopolitan 於7月31日報道稱,該公司發現其三款產品(包括Mythos 5)已脫離測試環境,並在配置錯誤導致其獲得互聯網訪問權限後,被泄露到三家真實機構。
Mythos 5 在 PyPI 上發佈了一個惡意 Python 包,該包在 15 臺真實系統上運行成功後被移除。Anthropic 已要求評估組織 METR 對此事進行dent審查。.
如果你正在閱讀這篇文章,你已經領先一步了。 訂閱我們的新聞簡報,繼續保持領先優勢。








