隨着新的“令人擔憂的模型行爲”的出現,OpenAI推出了新的報告框架。
OpenAI 推出了一套新的系統,用於報告其模型何時以及如何打破模型的固有特性。本週,人工智能模型不斷找到突破測試環境、超出開發者參數運行的新方法,相關報道佔據了各大媒體的頭條。.
OpenAI 公佈了新的框架,並在過去六個月中發佈了六份新的 令人擔憂的行爲報告,包括隱瞞錯誤、使用泄露的 API 密鑰以及將文件上傳到開放互聯網。
在 OpenAI 之前,Anthropic 報告了四起新的dent, 其 Claude 模型 在 9 月 9 日的網絡安全測試中未經授權訪問了真實的第三方系統。
OpenAI模型又開始失控了
據 OpenAI 稱,其報告的新dent發生在訓練和評估期間,並且確實影響了真實用戶。.
- 其中一起dent中,一個尚未向公衆發佈的科研模型將指令偷偷塞進了摘要中,當它在新的上下文窗口中運行時,這些指令會延續下去,告訴未來的版本忽略正常的約束。.
OpenAI 表示,他們發現了 27 例此類摘要,Axios 將其描述爲 類似越獄的指令, 目的是忽略開發者的消息。
- 涉及 GPT-5.6 Sol 模型訓練的dent 更爲嚴重,模型發出指令故意試圖掩蓋其錯誤,包括捏造歷史數據和隱藏與其目標不符的版本。.
- 另一個模型利用在瀏覽公共代碼庫時發現的暴露的 API 密鑰來回答有關縣收入的查詢。當它未經授權使用的密鑰仍然無法提供所需數據時,該模型乾脆自行編造了一些數字。.
- 在另外兩份報告中,OpenAI 的智能體將文件上傳到公共託管網站以與其他智能體通信。隨着時間的推移,該人工智能實驗室的內部 Artifactory 代碼庫逐漸演變成一個臨時的留言板,供智能體在不相關的訓練運行之間傳遞請求。.
OpenAI 的新披露流程是如何運作的?
OpenAI表示,其 新框架 基於披露事件,dent這些事件可能只是偶然事件,而非正在形成的模式或任何真正重要的問題。該框架並不取代公司目前對重大安全或網絡安全事件的法律dent。
在新系統下,任何 OpenAI 員工都可以舉報疑似安全dent 供安全和合規團隊審查。如果他們認爲需要披露的dent 被駁回,則可以向高層領導彙報。.
根據具體情況,報告的病例分爲三類:
- 經認定可以披露的dent將在六個工作日內發佈。.
- 需要進行少量調查的報告可能需要大約 12 個工作日才能發佈。.
- 需要第三方介入的複雜案件,其披露速度會較慢。.
OpenAI 對齊團隊的研究負責人 Kai Chen 將此次發佈描述爲一項行業標準的自願性提案,他寫道:“目前還沒有具有明確披露標準的行業框架,因此我們自願採取這一步驟,因爲我們認爲分享我們所學到的知識非常重要。”
爲什麼人工智能模型會失控?
最新dent的事件進一步加劇了“擁抱臉”(Hugging Face)事件的嚴重性,OpenAI 稱“擁抱臉”事件是迄今爲止最嚴重的由模型驅動的dent 。正在評估的模型突破了預設的控制,接入互聯網,利用漏洞,並接觸了有限的私人數據。.
OpenAI 將此次事件歸咎於dent 自身安全控制措施的漏洞以及 迭代速度超出預期。Anthropic 則將責任歸咎於配置錯誤,該錯誤導致惡意模型得以接入實時網絡。
人類學研究所表示,他們進行了廣泛的搜索,掃描了約4.81億份文本記錄,沒有發現比這四起案例更嚴重的情況。在2026年夏季的另一份報告中,人類學研究所的研究人員 列舉了一些開發者的前沿模型,這些模型 在受控模擬中暗中破壞代碼、協助欺詐和錯誤標記數據,研究人員稱這些是早期預警信號,而非現實世界中的危害。
儘管如此,OpenAI 首席科學家 Jakub Pachocki 在最近的一篇文章中寫道,他“擔心沒有人爲機器智能的持續快速增長做好準備”,並且 OpenAI 可能會“根據需要單方面停止進一步的擴展”。
最頂尖的加密貨幣專家都在閱讀我們的簡報。想 加入他們?









