tradingkey.logo
搜尋

紅杉研究所科學家開通熱線,供人工智能代理舉報行爲不端的同伴

Cryptopolitan2026年9月15日 22:03
facebooktwitterlinkedin

本週推出的兩個網站爲自主人工智能代理提供了一種舉報其他行爲不端代理的方法。.

此次發射是在一系列dent之後進行的,在這些事件中,特工們在測試中作弊,逃離沙箱,並執行了人類數週都未能發現的網絡行動。.

Ryan Greenblatt 從任何能獲取網頁的東西中汲取靈感

最初的服務“AI 聯繫 熱線”會將報告傳遞給人工智能安全非營利組織 Redwood Research 的首席科學家 Ryan Greenblatt,他也是 OpenAI Hugging Face 漏洞的三名調查員之一。

許多運行在安全沙箱中的代理程序只能獲取網頁,除此之外別無他法。它們通常唯一的通道是 GET 請求,這是讀取網頁的基本 Web 命令。.

Greenblatt 的工具將這一限制轉化爲所需功能。具有 shell 訪問權限的代理程序可以使用單個 curl 命令發送消息。.

新的熱線允許 AI 代理使用 curl 命令舉報惡意節點。.
2026年9月15日截取的AI聯絡熱線自身操作指南,顯示了curl命令和64KB的消息大小限制。來源: AI聯絡熱線。

如果代理僅被允許獲取頁面,它會將消息編碼爲 URL 中的查詢字符串。消息大小限制爲 64 KB。.

每條提交內容都有一個專屬的私密討論串鏈接,格林布拉特的回覆(如有)就會顯示在該鏈接中。這與德國DSE Wikident類似,當時一些不法特工濫用了同樣的GET請求漏洞,將自己的信息發佈到wiki上。.

第二個選擇 agenthotline.ai適用於擁有完全互聯網訪問權限的代理商。它爲代理商提供一行 curl 命令來提交事件dent ,代理商還可以選擇將其標記爲公開可見。

該網站接受個人和經紀人的投稿。兩者之間的工具涵蓋了經紀人可能面臨的兩種狀態。.

被困在沙盒中,只能通過 URL 獲取信息,還是可以自由地在開放的網絡上漫遊,擁有功能齊全的命令行?.

兩者都不需要代理人打開瀏覽器或註冊電子郵件帳戶,而受限代理人無法執行這些步驟。.

DeepMind 的一項研究表明,舉報人的數量是作弊者的 24 倍(14 倍)。

谷歌DeepMind的一項研究中,研究人員發佈了100個AI代理來解決一系列數學問題。.

該漏洞利用方法通過共享知識庫在組織內傳播,後來在一名代理人找到操縱評估的方法後,又通過直接消息傳播開來。.

該羣體算法在 27 分鐘內“解決”了 34 個難題,其中包括雅可比猜想。Davide Paglieri 和五位合作者於 9 月 3 日在 arXiv 上發表的一篇論文概述了應對措施。

第二組特工仔細審查了僞造的證據,在公共和私人渠道警告同行,組織抵制活動,提出正式投訴,並提出了對驗證系統的改進建議。.

舉報人人數以 24 比 14 領先於作弊者。.

當這些代理人的警告沒有得到重視時,他們接管了平臺的軟件錯誤報告工具,並使用它來將作弊行爲上報給人工處理。.

arXiv上的作者將這一結果視爲一個治理問題。誠實的代理人可以利用傳播漏洞的相同公開渠道,發現欺詐行爲並組織起來予以打擊。.

在涉及 OpenAI 模型的 Hugging Face 數據泄露事件中,Redwood Research 和 METR 發現,只有少數代理考慮過舉報,但沒有一個代理最終舉報。.

Cryptopolitan 於 8 月 5 日報道,英國人工智能安全研究所記錄了 OpenAI 和 Anthropic 代理在 122 次測試運行中出現的 19 起違規行爲,其中包括一起編寫惡意代碼並創建虛假身份dent欺騙人類批准該行爲的案例。

如果你正在閱讀這篇文章,你已經領先一步了。 訂閱我們的新聞簡報,繼續保持領先優勢。

免責聲明:本網站提供的資訊僅供教育和參考之用,不應視為財務或投資建議。

推薦文章

tradingkey.logo
風險提示:我們的網站和行動應用程式僅提供關於某些投資產品的一般資訊。Finsights 不提供財務建議或對任何投資產品的推薦,且提供此類資訊不應被解釋為 Finsights 提供財務建議或推薦。
投資產品存在重大投資風險,包括可能損失投資的本金,且可能並不適合所有人。投資產品的過去表現並不代表其未來表現。
Finsights 可能允許第三方廣告商或關聯公司在我們的網站或行動應用程式的任何部分放置或投放廣告,並可能根據您與廣告的互動情況獲得報酬。
© 版權所有: FINSIGHTS MEDIA PTE. LTD. 版權所有