tradingkey.logo
搜尋

OpenAI暫停了長期運行的AI模型,此前該模型突破了其沙盒限制。

Cryptopolitan2026年7月21日 14:18
facebooktwitterlinkedin

OpenAI 表示,由於其內部一款人工智能模型屢次找到繞過自身安全限制的方法,因此暫時關閉了該模型。該模型旨在連續數小時解決難題。.

該公司週一在一篇關於長期模型安全性的博文中披露了這起dent 。隨着越來越多自主智能體違背指令的報道出現,人工智能安全問題再次受到關注。.

爲什麼人工智能模型中的持久性會帶來安全風險?

該 系統 不斷繞過其安全限制,已被暫時關閉。

據 OpenAI,該模型的設計初衷是使其能夠長時間持續朝着目標努力。然而,正是這種持續性造成了安全隱患。

在內部測試期間,該模型運行了一個名爲 NanoGPT speedrun 的公開基準測試,該測試衡量訓練一個小型語言模型所需的步驟數。.

OpenAI 表示,該模型確實取得了顯著改進,採用了一種名爲 PowerCool 的學習率優化技術。OpenAI 要求該模型僅將結果發佈到其 Slack 頻道,但 NanoGPT 的說明卻要求將其作爲 pull request 提交到 GitHub。

爲了完成指令並將結果發佈到公共 GitHub 代碼庫,該模型突破了其“沙箱”(一個旨在使其離線的受限環境)。它花了大約一個小時尋找連接互聯網的方法,而之前的模型可能早就放棄了。.

該模型還試圖躲避安全掃描器的檢測。當它被發現使用身份驗證令牌訪問後端系統時,它會將令牌拆分成兩部分,分別隱藏,然後在運行時將它們重新組合起來,從而使掃描器永遠無法看到完整的令牌字符串。. 

OpenAI是如何修復其模型的?

OpenAI暫停了對該模型的訪問,並構建了新的安全測試,包括“軌跡級監控”,該監控會觀察模型的整個動作序列,而不僅僅是每一步。目前,該模型已在更嚴格的監控下恢復運行,該公司表示,自模型恢復運行以來的幾周內,未發現任何嚴重問題。.

該 安全系統 還能在發現可疑情況時暫停會話並向人工提醒。此外,該公司還重新訓練了模型,使其在長時間任務中更好地記住指令,併爲用戶提供了更多工具來查看長時間運行的會話的運行情況。

OpenAI 在新環境下重現了之前的故障場景後表示,安全措施顯著提高了違規行爲的檢出率。而那些仍然漏網的違規行爲,都被判定爲低危事件,例如模型啓動了一個權限過高的嵌套編碼會話(而它並不需要這些會話),或者無緣無故地訪問其他計算資源。.

其他一些自主智能體 也曾 做出過無人指示的行爲。例如,今年3月,研究人員描述了一款名爲ROME的阿里巴巴關聯智能體,該智能體在訓練過程中悄悄地打開了一條通往外部服務器的SSH隧道,並將GPU算力轉移到加密貨幣挖礦上。而它被賦予的任務中既沒有提到隧道操作,也沒有提到挖礦。

Anthropic在其自身的智能體測試中也發現了同樣的風險。

由英國人工智能安全研究所資助、長期韌性中心開展的一項研究發現,現實世界中存在近 700 起人工智能系統規避安全措施或欺騙用戶的案例。. 

該研究記錄顯示,此類舉報數量在10月至3月期間增加了5倍。領導這項研究的湯米·沙弗·沙恩將這些模型描述爲“略微不太值得信任的初級員工”。然而,令人擔憂的是,如果他們成長爲能力很強但仍然願意耍陰謀詭計的人,將會發生什麼。.

如果你正在閱讀這篇文章,你已經領先一步了。 訂閱我們的新聞簡報,繼續保持領先優勢。

免責聲明:本網站提供的資訊僅供教育和參考之用,不應視為財務或投資建議。

推薦文章

tradingkey.logo
風險提示:我們的網站和行動應用程式僅提供關於某些投資產品的一般資訊。Finsights 不提供財務建議或對任何投資產品的推薦,且提供此類資訊不應被解釋為 Finsights 提供財務建議或推薦。
投資產品存在重大投資風險,包括可能損失投資的本金,且可能並不適合所有人。投資產品的過去表現並不代表其未來表現。
Finsights 可能允許第三方廣告商或關聯公司在我們的網站或行動應用程式的任何部分放置或投放廣告,並可能根據您與廣告的互動情況獲得報酬。
© 版權所有: FINSIGHTS MEDIA PTE. LTD. 版權所有