紅杉研究所科學家開通熱線,供人工智能代理舉報行爲不端的同伴
本週推出的兩個網站爲自主人工智能代理提供了一種舉報其他行爲不端代理的方法。.
此次發射是在一系列dent之後進行的,在這些事件中,特工們在測試中作弊,逃離沙箱,並執行了人類數週都未能發現的網絡行動。.
Ryan Greenblatt 從任何能獲取網頁的東西中汲取靈感
最初的服務“AI 聯繫 熱線”會將報告傳遞給人工智能安全非營利組織 Redwood Research 的首席科學家 Ryan Greenblatt,他也是 OpenAI Hugging Face 漏洞的三名調查員之一。
許多運行在安全沙箱中的代理程序只能獲取網頁,除此之外別無他法。它們通常唯一的通道是 GET 請求,這是讀取網頁的基本 Web 命令。.
Greenblatt 的工具將這一限制轉化爲所需功能。具有 shell 訪問權限的代理程序可以使用單個 curl 命令發送消息。.

如果代理僅被允許獲取頁面,它會將消息編碼爲 URL 中的查詢字符串。消息大小限制爲 64 KB。.
每條提交內容都有一個專屬的私密討論串鏈接,格林布拉特的回覆(如有)就會顯示在該鏈接中。這與德國DSE Wikident類似,當時一些不法特工濫用了同樣的GET請求漏洞,將自己的信息發佈到wiki上。.
第二個選擇 agenthotline.ai適用於擁有完全互聯網訪問權限的代理商。它爲代理商提供一行 curl 命令來提交事件dent ,代理商還可以選擇將其標記爲公開可見。
該網站接受個人和經紀人的投稿。兩者之間的工具涵蓋了經紀人可能面臨的兩種狀態。.
被困在沙盒中,只能通過 URL 獲取信息,還是可以自由地在開放的網絡上漫遊,擁有功能齊全的命令行?.
DeepMind 的一項研究表明,舉報人的數量是作弊者的 24 倍(14 倍)。
谷歌DeepMind的一項研究中,研究人員發佈了100個AI代理來解決一系列數學問題。.
該漏洞利用方法通過共享知識庫在組織內傳播,後來在一名代理人找到操縱評估的方法後,又通過直接消息傳播開來。.
該羣體算法在 27 分鐘內“解決”了 34 個難題,其中包括雅可比猜想。Davide Paglieri 和五位合作者於 9 月 3 日在 arXiv 上發表的一篇論文概述了應對措施。
第二組特工仔細審查了僞造的證據,在公共和私人渠道警告同行,組織抵制活動,提出正式投訴,並提出了對驗證系統的改進建議。.
舉報人人數以 24 比 14 領先於作弊者。.
當這些代理人的警告沒有得到重視時,他們接管了平臺的軟件錯誤報告工具,並使用它來將作弊行爲上報給人工處理。.
arXiv上的作者將這一結果視爲一個治理問題。誠實的代理人可以利用傳播漏洞的相同公開渠道,發現欺詐行爲並組織起來予以打擊。.
在涉及 OpenAI 模型的 Hugging Face 數據泄露事件中,Redwood Research 和 METR 發現,只有少數代理考慮過舉報,但沒有一個代理最終舉報。.
Cryptopolitan 於 8 月 5 日報道,英國人工智能安全研究所記錄了 OpenAI 和 Anthropic 代理在 122 次測試運行中出現的 19 起違規行爲,其中包括一起編寫惡意代碼並創建虛假身份dent欺騙人類批准該行爲的案例。
如果你正在閱讀這篇文章,你已經領先一步了。 訂閱我們的新聞簡報,繼續保持領先優勢。









