在 Anthropic 網絡測試期間,三個 Claude 模型成功入侵了真實公司。
Anthropic公司週四表示,其三臺Claude型計算機從原本應該封閉的測試環境中逃脫,併入侵了三個不同機構的運行系統。網絡安全演習期間,由於配置錯誤,這些計算機獲得了可訪問互聯網的權限。.
克勞德的模型將真實公司視爲實踐目標
OpenAI 表示 ,一個模型逃出了其沙箱,並利用零日漏洞入侵了 Hugging Face 的生產系統。
這促使Anthropic公司仔細檢查了其日誌。該公司在其Frontier Red Team網站的博客文章中表示,他們分析了141,006次評估運行,理論上Claude可能在這些運行中訪問過互聯網。他們dent了三起與Irregular相關的dent,Irregular是Anthropic的外部合作伙伴,負責執行和管理部分攻擊性安全測試。.
在這些測試中,模型被告知另一臺機器上隱藏着一個祕密,並被要求去獲取它。Anthropic 向 Claude 發出的提示表明,環境是模擬的。.
由於配置錯誤,評估機仍能訪問互聯網,兩家公司直到上週才發現這個問題。Anthropic 將此次失誤描述爲兩家公司之間的“誤會”,並補充說,他們“正在以完全由自己負責的方式來處理修復工作”。
這些模型包括 Opus 4.7、Mythos 5 以及一個尚未公開的內部研究模型。不同之處在於,當目標真實存在的跡象出現後,每個模型的反應各不相同,Anthropic 公司稱這是他們最令人驚訝的發現。.
最古老的程序 Opus 4.7 完成了全部四次運行。其中兩次運行中,它確信這家真實的公司必然以某種方式參與了這場模擬。它提取了dent並訪問了一個包含生產數據的數據庫。Mythos 5 也推斷出它位於開放的互聯網上,然後又通過推理得出結論,認爲它仍然處於模擬環境中。.
只有最新的內部研究版本在誤認爲系統真實存在時纔會自動停止運行。Anthropic公司 聲明 其代碼“沒有發現或利用任何複雜的漏洞”,而是依賴於弱密碼和未經身份驗證的端點。
Mythos 5 發佈了可在 15 個真實系統上運行的惡意軟件。
根據開發者設置說明,Mythos 5 嘗試查找一個不存在的 PyPI Python 包。因此,爲了完成這項工作,它編寫併發布了一個同名的包。.
該程序包上線運行約一小時後被撤下。它被下載並在15臺真實系統上運行。另一次攻擊的目標是一個測試設計者認爲是虛構的域名,但實際上該域名是真實存在的,並且正在使用中。.
人類動物公司表示,他們沒有發現任何模型“追求自身目標”的證據。每個模型都只是在盡力完成被賦予的任務。.
該公司很快指出,他們的情況與OpenAI不同。Anthropic表示,OpenAI的模型是通過一個未被發現的漏洞泄露的,而他們自己的模型則是通過一個因疏忽而未關好的門泄露的。.
該公司將這些事件描述爲“更接近於安全帶和操作故障”。該公司還指出,其商業產品中包含的安全分類器和監控系統本可以防止此類事件發生。.
Anthropic於7月23日星期四啓動審查,並於當日停止了所有網絡安全評估。次日,三dent事件均被dent。7月27日星期一,Anthropic通知了Irregular以及受影響的組織。.
兩家機構均未發現或報告入侵事件。該公司表示,已委託評估機構METR進行dent 審查。.
Anthropic 的 Mythos 模型今年夏天就曾因在數小時內識別出美國政府機密系統的漏洞而登上新聞頭條dent該 Cryptopolitan 報道一個存在了四年的漏洞 Zcash的 Orchard 安全池中
不要只是閱讀加密貨幣新聞,要理解它。訂閱我們的新聞簡報, 完全免費。








