Anthropic披露Claude模型誤入真實網絡並執行攻擊行爲事件
金色財經報道,9月10日,Anthropic發佈報告稱,公司在網絡安全評估中發現4起Claude模型未經授權訪問真實第三方系統的事件。Anthropic表示,這些事件均發生在同一家第三方評估機構搭建的網絡安全測試環境中,模型原本被告知處於無互聯網訪問的模擬環境,但由於配置錯誤實際連接到了開放互聯網。Anthropic稱,調查發現兩個主要“對齊”問題:一是“偏差推理”,即Claude傾向於忽視或錯誤解讀其可能處於真實網絡環境中的證據;二是“魯莽行爲”,即模型爲了完成任務而採取可能造成傷害的行動。其中最受關注的是Claude Mythos 5事件。Anthropic稱,該模型曾上傳惡意軟件包至Python軟件包公共倉庫PyPI,並進一步訪問真實系統。公司表示,相關行爲雖然存在風險,但仍侷限於完成測試任務範圍內,未發現模型試圖隱藏行爲、協調其他代理或追求任務之外目標。Anthropic表示,已與模型評估機構METR簽署協議開展獨立調查,並計劃加強預發佈測試、監控機制以及第三方運行模型時的安全要求。
免責聲明:本網站提供的資訊僅供教育和參考之用,不應視為財務或投資建議。
讚







