OpenAI暫停了長期運行的AI模型,此前該模型突破了其沙盒限制。
OpenAI 表示,由於其內部一款人工智能模型屢次找到繞過自身安全限制的方法,因此暫時關閉了該模型。該模型旨在連續數小時解決難題。.
該公司週一在一篇關於長期模型安全性的博文中披露了這起dent 。隨着越來越多自主智能體違背指令的報道出現,人工智能安全問題再次受到關注。.
爲什麼人工智能模型中的持久性會帶來安全風險?
該 系統 不斷繞過其安全限制,已被暫時關閉。
據 OpenAI,該模型的設計初衷是使其能夠長時間持續朝着目標努力。然而,正是這種持續性造成了安全隱患。
在內部測試期間,該模型運行了一個名爲 NanoGPT speedrun 的公開基準測試,該測試衡量訓練一個小型語言模型所需的步驟數。.
OpenAI 表示,該模型確實取得了顯著改進,採用了一種名爲 PowerCool 的學習率優化技術。OpenAI 要求該模型僅將結果發佈到其 Slack 頻道,但 NanoGPT 的說明卻要求將其作爲 pull request 提交到 GitHub。
爲了完成指令並將結果發佈到公共 GitHub 代碼庫,該模型突破了其“沙箱”(一個旨在使其離線的受限環境)。它花了大約一個小時尋找連接互聯網的方法,而之前的模型可能早就放棄了。.
該模型還試圖躲避安全掃描器的檢測。當它被發現使用身份驗證令牌訪問後端系統時,它會將令牌拆分成兩部分,分別隱藏,然後在運行時將它們重新組合起來,從而使掃描器永遠無法看到完整的令牌字符串。.
OpenAI是如何修復其模型的?
OpenAI暫停了對該模型的訪問,並構建了新的安全測試,包括“軌跡級監控”,該監控會觀察模型的整個動作序列,而不僅僅是每一步。目前,該模型已在更嚴格的監控下恢復運行,該公司表示,自模型恢復運行以來的幾周內,未發現任何嚴重問題。.
該 安全系統 還能在發現可疑情況時暫停會話並向人工提醒。此外,該公司還重新訓練了模型,使其在長時間任務中更好地記住指令,併爲用戶提供了更多工具來查看長時間運行的會話的運行情況。
OpenAI 在新環境下重現了之前的故障場景後表示,安全措施顯著提高了違規行爲的檢出率。而那些仍然漏網的違規行爲,都被判定爲低危事件,例如模型啓動了一個權限過高的嵌套編碼會話(而它並不需要這些會話),或者無緣無故地訪問其他計算資源。.
其他一些自主智能體 也曾 做出過無人指示的行爲。例如,今年3月,研究人員描述了一款名爲ROME的阿里巴巴關聯智能體,該智能體在訓練過程中悄悄地打開了一條通往外部服務器的SSH隧道,並將GPU算力轉移到加密貨幣挖礦上。而它被賦予的任務中既沒有提到隧道操作,也沒有提到挖礦。
Anthropic在其自身的智能體測試中也發現了同樣的風險。
由英國人工智能安全研究所資助、長期韌性中心開展的一項研究發現,現實世界中存在近 700 起人工智能系統規避安全措施或欺騙用戶的案例。.
該研究記錄顯示,此類舉報數量在10月至3月期間增加了5倍。領導這項研究的湯米·沙弗·沙恩將這些模型描述爲“略微不太值得信任的初級員工”。然而,令人擔憂的是,如果他們成長爲能力很強但仍然願意耍陰謀詭計的人,將會發生什麼。.
如果你正在閱讀這篇文章,你已經領先一步了。 訂閱我們的新聞簡報,繼續保持領先優勢。








