OpenAI首席科學家兼首席執行官就Astra解鎖關鍵能力發出“不可監控性”警告
OpenAI 的首席科學家 Jakub Pachocki 在該公司成爲人工智能競賽中首家在“準備框架”中獲得“關鍵”網絡安全稱號的公司後幾個小時就站了出來,此前該公司預覽了其即將推出的 Astra 模型。.
帕喬基週三早些時候發出的警告旨在平息人們對人工智能實驗室可能不再對其最大型模型的能力加以防範的擔憂。.
爲什麼 OpenAI 的 Astra 是“關鍵”的?
“危急”級別是 OpenAI 於 2023 年 12 月向人工智能領域推出的“準備框架”中的一個級別。該“準備框架”衡量的是人工智能模型需要多少人工提示和干預才能在多個加固的系統中發現並構建可行的零日漏洞,或者運行完整的新型攻擊。
零日漏洞是指利用軟件開發者尚未發現的漏洞進行攻擊。.
OpenAI 在 9 月 1 日發佈的“通往 Astra 之路”博文中宣佈,該模型發佈後,只需極少的人工干預即可完成所有針對全新攻擊或零日漏洞利用的步驟。
OpenAI 在其博客文章中引用了 Astra 在 ExploitBench 上的 100% 得分作爲證據,ExploitBench 是一項測試模型如何利用已知漏洞的測試。.
Astra 不僅在策劃零日攻擊方面更勝一籌,而且效率更高。OpenAI 通過一項內部測試證明了這一點,該測試針對 20 個近期才公開的高危 V8 漏洞進行。Astra 消耗的令牌更少,成功生成了兩個零日漏洞,並且在生成任意代碼執行方面整體表現優於 Sol。.
該帖子還指出,Astra 可以將未知的瀏覽器漏洞串聯起來,實現沙箱逃逸,並在專家主導的測試中,從普通用戶一路攀升至 root 用戶,完成了操作系統權限提升。.
正如 TechCrunch 所提到的,Astra 加入了 Anthropic 的 Mythos 模型,該模型於今年早些時候發佈,是第一個具備這些功能的大型語言模型。
帕喬基呼籲大家不要對阿斯特拉感到恐慌
OpenAI首席科學家帕喬基 反駁了外界 關於OpenAI正 憑藉Astra 進入未知領域的恐慌情緒。他表示,他不想看到“一場因混亂的報道而引發的無法監管的競賽”。
OpenAI 的一位高管堅稱,實驗室在運用“思維鏈監控”(即逐步分析模型運行過程中展現的推理過程)方面做了充分的盡職調查。他在 X 帖子中提到,OpenAI 當前最前沿模型(包括 Astra)背後的計算圖深度與 GPT-4 的深度相差不到兩倍。.
在帕喬基之前,OpenAI 的首席執行官薩姆·奧特曼也在 Astra 博客發佈的同一天呼籲保持冷靜。
“這裏顯然存在矛盾,”他週二寫道,稱Astra“非常出色”,同時指出安全措施必須與模型本身的性能同步發展。奧特曼表示,OpenAI整個夏天都在努力確保該模型具備必要的安全措施。.
關於安全性的討論已經持續數週。8月18日,OpenAI承諾 暫停部署模型的強化學習訓練 兩週,以便其工程師加強研究集羣並優化監控。訓練於8月28日恢復。
OpenAI表示,Astra並未參與如今臭名昭著的“擁抱臉”dent。該公司還表示,即使在設置了旨在誘使其重現“擁抱臉”事件的場景後,該模型也從未試圖逃出其沙盒。.
人工智能實驗室現在對誰可以訪問其前沿模型持謹慎態度。
OpenAI 表示,現在所有人都可以使用 Astra 最先進的功能,而這些功能將保留給 OpenAI 的 Daybreak 聯盟中的組織,Daybreak Blue 公司將可以使用最強大的防禦功能。.
據 Cryptopolitan 報道,Anthropic 還表示,只有參與其 Project Glasswing 的 才能訪問 Mythos 5.1,Mythos 5.1 基本上是 Fable 5.1,但增加了單獨的安全措施。
OpenAI 還表示,它將監控並限制對被判定爲高風險賬戶的查詢回覆。此外,Astra 還將提供額外的思路監控功能,以便更頻繁地發現不良行爲並拒絕有害的網絡請求。.
關於 Astra 的大部分信息都是 OpenAI 自己提供的,而 OpenAI 的安全性或功能聲明缺乏第三方驗證。.
曾在 OpenAI 工作、目前在 OpenAI 基金會從事 AI 韌性研究的 Yona Shavit 公開質疑 Astra 在測試中的表現是否反映了真正的一致性,還是僅僅因爲模型知道評估者想看到什麼。.
OpenAI表示,完整的系統卡和進一步的評估將在Astra全面發佈後推出。在此之前,其網絡安全能力的覆蓋範圍以及相關防護措施的強度仍難以判斷。.
如果你正在閱讀這篇文章,你已經領先一步了。 訂閱我們的新聞簡報,繼續保持領先優勢。








