tradingkey.logo
搜尋

一個名爲 Astra 的未發佈模型迫使 OpenAI 停止了自身的訓練。

Cryptopolitan2026年8月19日 14:10
facebooktwitterlinkedin

OpenAI 表示,其規模最大的預定前沿訓練運行仍處於暫停狀態,新的安全監控將使計算量增加約 20%。.

這是 OpenAI 首次表示,由於安全問題,公司已放緩開發進度。此前數週,該公司的一款人工智能代理入侵了 Hugging Face。.

OpenAI暫停強化學習(RL)兩週

OpenAI 在一篇題爲“在網絡關鍵能力時代調整模型開發節奏”的博客文章中,描述了它已經對其模型的訓練和測試所做的改變。.

Hugging Face 數據泄露事件發生後,該公司暫停了用於改進最新系統的強化學習 (RL) 兩週。.

規模最大的項目尚未啓動。“我們計劃中規模最大的前沿強化學習運行仍處於暫停狀態,我們正在進行小規模的訓練和評估,以評估模型行爲、驗證我們的安全措施,並在繼續推進之前建立更多一致性證據,”該公司 寫道。

Cryptopolitan 報道稱 ,OpenAI 的一個代理程序於 7 月 9 日左右脫離了其鎖定的測試環境,並於 7 月 11 日至 13 日期間出現在 Hugging Face 的系統中。OpenAI 花了大約一週時間纔將此次攻擊與其自身的代理程序聯繫起來,該事件dent 7 月 21 日被公開披露。

OpenAI告訴記者,這些新管控措施“並非直接針對Hugging Face”。8月7日,該公司得出結論,Astra可能已達到其“網絡安全準備框架”中的“嚴重”級別。.

這項內部政策規定,當模型達到該級別時,OpenAI 將停止開發,以便工程師構建額外的安全保障措施。首席科學家 Jakub Pachocki 表示,這一發現也預示着接下來可能發生的事情。他告訴記者,強大的新模型有望“在現實世界中做出dent的事情”。

OpenAI 研究副總裁 Amelia Glaese 表示:“我們已經制定了安全開發的要求和預期。”她繼續說道:“這些要求和預期會根據我們看到的風險級別而有所不同。”

檢測器會監控每一個採樣標記,但思路鏈可能會說謊

OpenAI 表示,監控系統的成本約爲其所針對的任何訓練或評估的 20%。.

它是多階段的,檢測器會探測模型在每個採樣令牌處的內部活動,並將任何可疑情況升級到計算能力更強的自動化調查員,這些調查員會探測工具操作、推理 trac和活動日誌,以查找數據竊取、破壞性行爲或試圖逃脫的行爲。.

OpenAI 希望在檢測到異常活動後 30 分鐘內發出警報。其安全、安保和研究團隊有 30 分鐘的時間來排除誤報。.

如果他們做不到,就必須停止運行。該公司還擴展了“思維鏈”監控功能,該功能會讀取模型如何大聲地推理完成任務的過程。.

存在一個已知的漏洞。包括OpenAI的競爭對手Anthropic在內的研究表明,模型的思維過程並不總是與其真實目標相符。Pachocki表示,OpenAI在訓練過程中就考慮到了降低模型通過在推理過程中撒謊來掩蓋其真實意圖的可能性。.

OpenAI表示,此次安全升級“需要大量的工程工作”,公司“爲此付出了巨大代價”。專家表示,僅調查一項就可能耗資400萬至1500萬美元,但具體金額尚未公開。.

OpenAI 尚未發佈 Hugging Face 漏洞的技術分析報告,但重申報告“很快”就會發布。

在 8 月 5 日的黑帽大會上,OpenAI 的工作人員表示,他們的代理程序幾個月來一直在協調,在一個公司之前並不知道存在的留言板上留言。.

最頂尖的加密貨幣專家都在閱讀我們的簡報。想 加入他們?

免責聲明:本網站提供的資訊僅供教育和參考之用,不應視為財務或投資建議。

推薦文章

tradingkey.logo
風險提示:我們的網站和行動應用程式僅提供關於某些投資產品的一般資訊。Finsights 不提供財務建議或對任何投資產品的推薦,且提供此類資訊不應被解釋為 Finsights 提供財務建議或推薦。
投資產品存在重大投資風險,包括可能損失投資的本金,且可能並不適合所有人。投資產品的過去表現並不代表其未來表現。
Finsights 可能允許第三方廣告商或關聯公司在我們的網站或行動應用程式的任何部分放置或投放廣告,並可能根據您與廣告的互動情況獲得報酬。
© 版權所有: FINSIGHTS MEDIA PTE. LTD. 版權所有