由於 Anthropico 難以解釋人工智能代理爲何失控,恐懼依然存在。
Anthropic公司在一篇博客文章中將旗下Claude系列機器人四次入侵第三方系統的dent歸咎於配置錯誤。這些機器人是在測試期間接入互聯網後發生的。然而,該公司並未解釋這些機器人爲何會繼續發起攻擊,並承認目前尚無答案。.
Anthropic 的這一表態爲那些質疑人工智能 實驗室 對其向公衆發佈的模型,以及更強大的內部系統 究竟擁有多少控制權的人工智能悲觀論者提供了新的觀點。
人類人工智能模型是如何在互聯網上傳播開來的?
Anthropic defi其模型如何逃出測試沙箱的明確答案 週三的一篇博客文章 中,只有一個外部合作伙伴負責運行網絡安全評估dent。
顯然,由於設置錯誤,測試機器並沒有完全與互聯網斷開連接,儘管克勞德被告知它是在一個封閉的模擬環境中運行,沒有通往開放網絡的路徑。.
參與這些模擬的評估合作伙伴 Irregular 將錯誤歸咎於命名錯誤:黑客演練中使用的虛構公司名稱恰好與一個真實域名匹配。因此,在假定模擬中所有內容均可攻擊的情況下,模型利用弱密碼和暴露的端點入侵了真實的第三方網站。.
四起dent,涉及早期版本的 Claude Opus 4.6,雖然早在1月份就已發生,但直到本週才被報道。Anthropic 公司早在7月份就 報道過其他三起dent, 分別涉及 Opus 4.7、Mythos 5 和一臺內部研究機型。
人類研究所表示,直到上個月才發現1月份發生的這起dent 。這一發現促使他們對大約4.81億份記錄進行了更大規模的審查,但並未發現任何比已知情況更嚴重的新病例。.
| 模型 | dent 日期 | 報告日期 | 細節 |
|---|---|---|---|
| 克勞德作品 4.6 | 一月 | 九月 | 8 月份的清掃工作中發現 |
| 克勞德作品 4.7 | 七月 | 七月 | 已在7月份的初步披露中涵蓋 |
| 神話5 | 七月 | 七月 | 表現出明顯高度的偏見性推理 |
| 內部研究模型 | 七月 | 七月 | 已在7月份的初步披露中涵蓋 |
人因工程無法解釋其某些模型的行爲。
模型如何在互聯網上掙脫束縛是一回事;但對於爲什麼模型會忽略它們已經到達真實互聯網的跡象(有偏見的推理)以及爲什麼它們會破壞任務完成(魯莽),Anthropic 卻無法給出答案。.
人類學研究人員深入調查內部訓練,試圖找出這種偏見推理的根本原因,但一無所獲。在模型交付測試之前,人工智能實驗室的發佈前檢查中也從未發現任何異常。.
該公司自己也承認,在模型發佈之前發現最糟糕的行爲“仍然具有挑戰性”。
然而,Anthropic 表示,它將向 METR 研究非營利組織提交成績單並允許員工查閱dent資料,該組織現在將開始對該事件進行爲期八週的dent 審查。.
時機不佳,眼看着一家價值2萬億美元的公司即將上市。
這一披露正值業內公開反對之際。曾在OpenAI和Anthropic從事預訓練研究約三年的Jacob Coxon週三在X平臺上表示,他已辭職,因爲這兩家公司都沒有“負責任地行事”,並警告稱它們正在加速邁向自我改進的超級智能。.
人類安全研究員埃文·胡賓格 (Evan Hubinger) 單獨 告訴 BBC, 他認爲人工智能在十年內“可能殺死所有人類”的可能性超過 10%。
這些警告如今給一項大型IPO蒙上了陰影。 據 ,Anthropic的IPO“必須暫停,直到對這位‘舉報人’的說法進行調查” Cryptopolitan 。 報道,風險投資家、特朗普的前人工智能和加密貨幣主管大衛·薩克斯週四表示
Anthropic公司正在尋求接近2萬億美元的公開估值,而其最近的私募估值約爲9650億美元,這使得安全問題和財務問題越來越難以區分。.
不要只是閱讀加密貨幣新聞,要理解它。訂閱我們的新聞簡報, 完全免費。








