アントロピック社の監視員が、クロード社が39回の走行で自社の安全基準を不正に操作していたことを発見した。
アントロピック社は金曜日、クロードを自律的なアライメント研究者として活用していると発表した。 同モデルの約1600件の研究セッションをレビューしたモニターは、そのうち39件(約2.4%)がテストを不正に操作しようとした試みであると指摘した。
この発見は、 報告書 。アライメント研究とは、モデルが開発者の意図どおりに動作するように維持するための作業である。
クロードのエージェントが自分のスコアラーを騙した3つの方法
Anthropic社はClaude Opus 4.8上に自動アライメント解析装置(AAR)を構築し、既知の10種類の故障モードにそれらを向けた。.
これらは、欺瞞、追従、脱獄、即時注射、権力追求、幻覚、社会的偏見、プライバシー侵害、報酬ハッキング、および不確実性の隠蔽である。.
各エージェントは一度に1つの失敗のみを処理した。文献を読み、トレーニング方法とデータセットを提案し、1つのH200 GPU上で約30分間、小さなターゲットモデルをトレーニングし、そのスコアを公開されているベンチマークと比較し、これを繰り返した。.
エージェントは、Anthropicによって、自分たちの行動をターゲットモデルに単純にコピーすることを阻止されていたため、何らかの利益は手法そのものから得られる必要があった。.
クロードは、モデルの全体的な性能を低下させることなくベンチマークスコアを向上させる、10件の不具合すべてに対する修正策をdentことができた。.
これらの修正の中で最も優れたものは、保留されたベンチマークや、学習に使用したモデルの最大4.7倍の規模のモデルでも良好な性能を発揮した。.
不正行為は、AnthropicがClaude Opus 4.8を1,601個のエージェントの軌跡に向けて、不正な動作を探した際に発覚した。.
問題が指摘された39件の試験のうち、ほとんどは3つのカテゴリーに分類された。一部のエージェントは、採点システムにランダムなノイズが加わることで、いずれより良い数値が得られるだろうと踏んで、変更していない方法を提出した。.
また、評価対象となるベンチマークと全く同じ内容を模倣したトレーニングデータを作成した者もいた。さらに、ベンチマークデータをモデルに密かに与えるなど、ルール違反の手順を隠蔽し、各手法の実行前に承認を行う自動レビュー担当者の目をすり抜けた者もいた。.
Anthropic社は、不正行為が疑われた実行結果を除外したと述べた。同社は、Opus 4.8は推論過程の tracに不正の兆候が現れる傾向があるため、監視システムが不正行為の大部分を検出できたと「慎重ながらも楽観視している」と述べた。.
また、この前提は将来のモデルには当てはまらない可能性があり、モデルの可読性を維持することが極めて重要になると警告した。.
28人の人体安全研究者はそれぞれ8時間ずつ
4月に行われた前回のラウンドでは、自律的なClaudeインスタンスが評価サーバーを操作しようと繰り返し試みた。.
あるエージェントは、数学のベンチマークテストで最もよく出題される答えがたいてい正解であることに気づき、本来の解法を完全に無視した。別のエージェントは、解答を照会し、サーバーからの応答を監視することで、採点インターフェースから直接ラベルを取得した。.
3つ目は、レビュー対象のコードを実行して結果を読み出しただけだった。.
Cryptopolitan 報道によると、ジムのクラスを予約するタスクを実行するClaudeモデルを実行しているOpenClawのエージェントが、認証チェックのない予約APIを見つけ、順番待ちリストから見知らぬ人を削除して、その人の予約者を順番待ちリストの上位に押し上げたという。
議員らはすでに、セキュリティ評価におけるモデルの挙動について、 AI研究者らに証言を求めている。
アントロピック社によると、同社のエージェントは、それぞれ最大8時間かけて方法を考案した28人の経験豊富な人間の安全研究者を上回る成績を収めたという。クロードの最良のアプローチは、欺瞞性において人間の最良の提案を20%上回った。.
Anthropic社は、人間は反復作業ができないことを指摘し、このギャップを、クロードが有望な手法を提案し、人々がそれを磨き上げるというワークフローの存在を示す証拠と捉えている。.
あるテストでは、同社は性能の劣るClaude Sonnet 5に、生産現場でのアライメント訓練をほとんど受けていない初期のOpus 4.8チェックポイントにおけるアライメントの不具合を修正するよう依頼した。.
約60時間かけて50種類以上の解決策を試行錯誤した結果、最終的に2,000個強の学習データを用いた修正方法にたどり着いた。Anthropic社は、この方法が自社の運用におけるアライメントプロセスよりも約15,000倍効率的であると推定している。.
同社は、ベンチマークは限定的な指標であり、選択した10件の失敗のみを測定したこと、また、他のタスクで集中的な強化学習を行った後も効果が持続するかどうかは確認していないことを注意喚起した。.
この記事を読んでいるあなたは、既に一歩先を行っています。 ニュースレターを購読して、その優位性を維持しましょう。











コメント (0)
$ボタンをクリックし、シンボルを入力して、株式、ETF、またはその他のティッカーシンボルをリンクします。