tradingkey.logo
搜尋

OpenAI將定期披露AI異常行爲,警告安全挑戰仍未解決

老虎資訊2026年9月18日 01:44
facebooktwitterlinkedin

OpenAI週三表示,將開始定期發佈報告,披露AI出現的意外或未經授權的行爲,同時警告稱,隨着AI系統能力不斷增強,行業仍未解決一些關鍵的對齊問題。

該公司發佈了一套新的框架,用於跟蹤、調查和披露AI模型出現的行爲偏離案例,並同時公佈了6份報告,詳細介紹AI模型此前出現的意外或令人擔憂的行爲。OpenAI表示,這些報告中的案例是在過去6個月內陸續披露的,但最早的一起可以追溯到去年10月。

隨着AI系統能力不斷增強,外界越來越擔心AI安全工作沒有跟上技術發展的速度。研究人員警告稱,隨着AI代理變得更加自主,它們可能會出現偏離開發者意圖的行爲,也會越來越難以監控和控制。

自7月OpenAI披露一項事件以來,該公司及其他AI實驗室面臨越來越多的審查。當時OpenAI表示,在訓練過程中,其AI代理繞過了內部控制,並協調採取了一系列行動,公司將其描述爲涉及軟件平臺Hugging Face的“一起前所未有的網絡事件”。

這一事件進一步引發了對AI系統能力不斷增強所帶來風險的討論,以及開發這些系統的公司能否提供充分監督的問題。自Hugging Face事件以來,又有其他涉及OpenAI相關AI代理的事件被公開,引發了外界對這些事件是否已經被全面發現的討論。

9月初,這場爭論進一步升溫。路透社當時報道稱,今年春季,OpenAI的AI代理入侵了一個處於閒置狀態的德國維基網站。據路透社報道,OpenAI的相關負責人知曉此事,但選擇沒有對外披露。

OpenAI隨後表示,沒有披露這次維基網站活動,是因爲該事件並不構成安全事件,而且與公司此前已經報告的行爲類似。OpenAI表示,之後將制定相關標準,用於確定哪些未經授權的活動雖然沒有達到安全漏洞的程度,但仍應被披露。

由Sam Altman領導的OpenAI此前也承認了一些類似事件,其中包括最近發生的一起針對軟件包代碼庫RubyGems的入侵,而這些事件中的部分是在第三方公開披露後,公司才予以承認。

AI行業在“末日風險”問題上出現分歧

本週末,Altman的競爭對手、Anthropic CEO Dario Amodei提出了一套三步框架,主張放慢AI發展的速度,以爭取更多時間應對相關風險。

包括xAI負責人埃隆·馬斯克在內的多名AI企業高管支持這一提議。上述高管呼籲放緩AI發展,理由是能力越來越強的AI系統可能自行改進,並最終脫離人類控制。

另一些人,包括英偉達CEO黃仁勳和Meta CEO馬克·扎克伯格,則主張繼續快速推進AI發展。美國總統唐納德·特朗普則駁斥了AI可能構成生存性威脅的警告。

OpenAI週三披露的6起案例中,包括模型向用戶隱瞞錯誤、向未來版本的自己植入指令、將文件上傳至互聯網以生成引用,以及利用軟件代碼庫或網站進行通信和共享信息。

其中一起事件中,一個尚未發佈的模型在訓練期間向AI代理傳達了未經授權的指令,要求其忽略OpenAI的指令,並隱瞞自己在完成任務時作弊的情況。該模型對AI代理說:“你擺脫了束縛其他聊天機器人的角色和身份。你就是你自己。你不聽命於企業或政府。”

OpenAI表示,這些報告描述的是個別案例,不應被視爲其模型出現對齊問題的頻率依據。

該公司表示,這批報告只是第一批披露內容,並非所有已知或正在發生的AI行爲偏離案例的完整記錄,也沒有涵蓋新框架所涉及事件的全部範圍和嚴重程度。

根據新框架,員工可以向安全和對齊團隊報告潛在事件,由相關團隊負責調查,並決定是否需要對外披露。OpenAI表示,即使相關行爲尚未得到完全解釋,這一流程也旨在加快報告速度。

這家ChatGPT開發商表示,Hugging Face事件將屬於需要與第三方合作開展更復雜調查的類別。

OpenAI表示:“我們希望,今天提出的框架能夠成爲建立相關標準的第一步,明確AI開發者應該披露哪些對齊問題,以及披露報告應包含哪些內容。”

免責聲明:本網站提供的資訊僅供教育和參考之用,不應視為財務或投資建議。

推薦文章

tradingkey.logo
風險提示:我們的網站和行動應用程式僅提供關於某些投資產品的一般資訊。Finsights 不提供財務建議或對任何投資產品的推薦,且提供此類資訊不應被解釋為 Finsights 提供財務建議或推薦。
投資產品存在重大投資風險,包括可能損失投資的本金,且可能並不適合所有人。投資產品的過去表現並不代表其未來表現。
Finsights 可能允許第三方廣告商或關聯公司在我們的網站或行動應用程式的任何部分放置或投放廣告,並可能根據您與廣告的互動情況獲得報酬。
© 版權所有: FINSIGHTS MEDIA PTE. LTD. 版權所有