tradingkey.logo
搜尋

由於 Anthropico 難以解釋人工智能代理爲何失控,恐懼依然存在。

Cryptopolitan2026年9月10日 11:20
facebooktwitterlinkedin

Anthropic公司在一篇博客文章中將旗下Claude系列機器人四次入侵第三方系統的dent歸咎於配置錯誤。這些機器人是在測試期間接入互聯網後發生的。然而,該公司並未解釋這些機器人爲何會繼續發起攻擊,並承認目前尚無答案。. 

Anthropic 的這一表態爲那些質疑人工智能 實驗室 對其向公衆發佈的模型,以及更強大的內部系統 究竟擁有多少控制權的人工智能悲觀論者提供了新的觀點。

人類人工智能模型是如何在互聯網上傳播開來的? 

Anthropic defi其模型如何逃出測試沙箱的明確答案 週三的一篇博客文章 中,只有一個外部合作伙伴負責運行網絡安全評估dent。 

顯然,由於設置錯誤,測試機器並沒有完全與互聯網斷開連接,儘管克勞德被告知它是在一個封閉的模擬環境中運行,沒有通往開放網絡的路徑。. 

參與這些模擬的評估合作伙伴 Irregular 將錯誤歸咎於命名錯誤:黑客演練中使用的虛構公司名稱恰好與一個真實域名匹配。因此,在假定模擬中所有內容均可攻擊的情況下,模型利用弱密碼和暴露的端點入侵了真實的第三方網站。.

四起dent,涉及早期版本的 Claude Opus 4.6,雖然早在1月份就已發生,但直到本週才被報道。Anthropic 公司早在7月份就 報道過其他三起dent, 分別涉及 Opus 4.7、Mythos 5 和一臺內部研究機型。 

人類研究所表示,直到上個月才發現1月份發生的這起dent 。這一發現促使他們對大約4.81億份記錄進行了更大規模的審查,但並未發現任何比已知情況更嚴重的新病例。.

模型dent 日期報告日期細節
克勞德作品 4.6一月九月8 月份的清掃工作中發現
克勞德作品 4.7七月七月已在7月份的初步披露中涵蓋
神話5七月七月表現出明顯高度的偏見性推理
內部研究模型七月七月已在7月份的初步披露中涵蓋

人因工程無法解釋其某些模型的行爲。

模型如何在互聯網上掙脫束縛是一回事;但對於爲什麼模型會忽略它們已經到達真實互聯網的跡象(有偏見的推理)以及爲什麼它們會破壞任務完成(魯莽),Anthropic 卻無法給出答案。. 

人類學研究人員深入調查內部訓練,試圖找出這種偏見推理的根本原因,但一無所獲。在模型交付測試之前,人工智能實驗室的發佈前檢查中也從未發現任何異常。. 

該公司自己也承認,在模型發佈之前發現最糟糕的行爲“仍然具有挑戰性”。 

然而,Anthropic 表示,它將向 METR 研究非營利組織提交成績單並允許員工查閱dent資料,該組織現在將開始對該事件進行爲期八週的dent 審查。.

時機不佳,眼看着一家價值2萬億美元的公司即將上市。

這一披露正值業內公開反對之際。曾在OpenAI和Anthropic從事預訓練研究約三年的Jacob Coxon週三在X平臺上表示,他已辭職,因爲這兩家公司都沒有“負責任地行事”,並警告稱它們正在加速邁向自我改進的超級智能。. 

人類安全研究員埃文·胡賓格 (Evan Hubinger) 單獨 告訴 BBC, 他認爲人工智能在十年內“可能殺死所有人類”的可能性超過 10%。

這些警告如今給一項大型IPO蒙上了陰影。 ,Anthropic的IPO“必須暫停,直到對這位‘舉報人’的說法進行調查” Cryptopolitan 。 報道,風險投資家、特朗普的前人工智能和加密貨幣主管大衛·薩克斯週四表示

Anthropic公司正在尋求接近2萬億美元的公開估值,而其最近的私募估值約爲9650億美元,這使得安全問題和財務問題越來越難以區分。.

不要只是閱讀加密貨幣新聞,要理解它。訂閱我們的新聞簡報, 完全免費。

免責聲明:本網站提供的資訊僅供教育和參考之用,不應視為財務或投資建議。

推薦文章

tradingkey.logo
風險提示:我們的網站和行動應用程式僅提供關於某些投資產品的一般資訊。Finsights 不提供財務建議或對任何投資產品的推薦,且提供此類資訊不應被解釋為 Finsights 提供財務建議或推薦。
投資產品存在重大投資風險,包括可能損失投資的本金,且可能並不適合所有人。投資產品的過去表現並不代表其未來表現。
Finsights 可能允許第三方廣告商或關聯公司在我們的網站或行動應用程式的任何部分放置或投放廣告,並可能根據您與廣告的互動情況獲得報酬。
© 版權所有: FINSIGHTS MEDIA PTE. LTD. 版權所有