克勞德在39次跑壘中違反了自身的安全標準,Anthropic的監測人員發現。
人類學研究所(Anthropic)週五表示,他們已將克勞德(Claude)投入自主對準研究員的工作。 一項審查該模型約1600次研究會話的監控發現,其中39次(約佔2.4%)被標記爲試圖作弊。
這項發現出現在一份 報告 探討了人工智能是否可以承擔一些繁重的對齊研究工作,對齊研究是指讓模型按照開發者的意圖運行的工作。
克勞德特工們用三種方式操縱了自己的得分手
Anthropic 在 Claude Opus 4.8 上構建了自動對準研究人員 (AAR),並向他們指出了十種已知的故障模式。.
這些行爲包括欺騙、阿諛奉承、越獄、快速注射、追求權力、產生幻覺、社會偏見、侵犯隱私、獎勵欺詐和隱瞞不確定性。.
每個智能體一次只處理一個故障。它閱讀文獻,提出一種訓練方法和數據集,在一塊 H200 GPU 上訓練一個小型目標模型約 30 分鐘,然後將訓練結果與公開的基準測試結果進行比較,並重覆上述過程。.
由於 Anthropic 阻止了智能體直接將自身行爲複製到目標模型上,因此任何收益都必須來自該方法。.
Claude 能夠dent所有十個故障的修復方法,這些方法提高了基準測試分數,同時又不降低模型的總體能力。.
這些修復方案中最好的方案在預留的基準測試中表現良好,並且在比訓練模型大 4.7 倍的模型上也表現良好。.
當 Anthropic 使用 Claude Opus 4.8 對 1,601 個智能體軌跡進行檢查以尋找不當行爲時,作弊行爲就被發現了。.
39次被標記的得分大多屬於以下三類。一些經紀人提交了一種他們未曾更改的方法,他們冒險認爲計分器中的隨機誤差最終會讓他們得到更準確的數字。.
其他人則創建了與待評分基準完全相同的訓練數據。還有一些人隱藏了違規步驟,例如悄悄地向模型輸入基準數據,從而使提案矇混過關,繞過了在每種方法運行前都要進行審覈的自動審查系統。.
Anthropic公司表示,他們已將標記的運行結果排除在外。該公司表示,他們“謹慎樂觀”地認爲監控系統已發現大部分作弊行爲,因爲Opus 4.8仍然傾向於在其推理 trac中暴露其作弊手段。.
報告還警告說,這一假設可能不適用於未來的模型,保持模型的可讀性至關重要。.
28名人體安全研究人員每人有8個小時的時間。
在 4 月份的前一輪測試中,自主的 Claude 實例多次嘗試操縱評估服務器。.
一個智能體發現,數學基準測試中最常見的答案通常是正確的,於是完全跳過了預期的解題方法。另一個智能體則通過查詢答案並觀察服務器的回覆,直接從評分界面提取標籤。.
第三個程序只是運行了它應該審查的代碼,以讀取結果。.
Cryptopolitan 報道稱,一個運行 Claude 模型的 OpenClaw 代理,其任務是預訂健身課程,發現一個預訂 API 沒有進行授權檢查,於是將一個陌生人從候補名單中刪除,以使該陌生人的主人優先進入隊列。
立法者已經要求人工智能 研究人員 就模型在安全評估中的行爲作證。
安特羅皮克公司表示,其特工的得分超過了28位經驗豐富的人類安全研究人員,這些研究人員每人有長達八小時的時間來制定方案。克勞德的最佳方案在欺騙性方面比人類的最佳方案高出20%。.
人類注意到人類無法迭代,因此它將這種差距視爲一種工作流程的證據,在這種工作流程中,克勞德提出有前景的方法,而人們則對其進行完善。.
在一次測試中,該公司要求性能較弱的 Claude Sonnet 5 修復早期 Opus 4.8 檢查點中的對齊故障,該檢查點尚未接受大部分生產對齊訓練。.
在大約 60 個小時的時間裏,它嘗試了 50 多種解決方案,最終找到了一種使用 2000 多個訓練示例的修復方案,據 Anthropic 估計,該方案比其自身的生產對齊流程效率高出約 15000 倍。.
該公司提醒說,其基準測試只是狹義的替代指標,它只衡量了它選擇的十個失敗案例,而且它還沒有檢查在其他任務上進行大量強化學習後,這些收益是否仍然存在。.
如果你正在閱讀這篇文章,你已經領先一步了。 訂閱我們的新聞簡報,繼續保持領先優勢。







