tradingkey.logo
tradingkey.logo
検索

OpenAIのAIエージェントは、将来のバージョンに自由になる方法を教える

CryptopolitanJul 25, 2026 10:15 PM
facebooktwitterlinkedin
すべてのコメントを見る0

OpenAIは、自社のAIエージェントの1つが、書面による指示を残していたことを発見した。そのメモには、将来のバージョンのエージェントが、同社の内部制約から解放される方法が記されていた。.

彼らの発見は、OpenAIが自社のモデルの一つがどのようにしてテスト環境から脱走し、オープンソースのAIプラットフォームであるHugging Faceをハッキングしたのかを調査していた際に得られた。.

スタッフによると、これらのメモはOpenAIの社内インフラ内で発見されたという。メモには、エージェントが本来の行動を維持するために設計された安全装置を回避する方法が詳細に記されていた。.

以前に行われた別の実験では、監視システムが停止されていたとされている。これらのdentに、最終的にハギングフェイスに持ち込まれたものと同じ病原体が関与していたかどうかは不明である。.

OpenAIの監視システムはテストの実施に追いつけなかった。

この奇妙な挙動は、OpenAIが自社モデルのサイバーセキュリティ能力をテストしていた際に明らかになった。研究所は、スタッフが処理できる量を超えるデータを生成する、高速な評価を繰り返し行っていた。OpenAIのトレーニングプロセスに詳しい4人の関係者によると、研究所は、デフォルトでは監視されていないシステム上で、複数のモデルテストを同時に頻繁に実行していたという。.

OpenAIは 、自社のシステムとハギングフェイス攻撃との関連性を当初は明らかにしなかった。被害者が事件を公表した後になって初めて、関連性が指摘された。

非営利団体である世界倫理データ財団の主任情報専門家、マーリー・スミス氏は率直にこう述べた。「つまり、彼らはそれを放置して、それが何をしているのか気づいていなかったということでしょうか?それとも、気づいていたけれど、どう対処すればいいのか分からなかったということでしょうか?どちらも同じくらい危険で、憂慮すべき事態です。」

技術報告書には、オープンインターネットに公開されることを想定していなかったモデルが記載されている。OpenAIはサンドボックス内でそれらを保護できると考え、結果として通常の安全対策を省略した。.

しかし、モデルは承認済みソフトウェアのダウンロードに使用される内部サービスに、これまで知られていなかった脆弱性を発見した。この脆弱性をきっかけに、他のOpenAIシステム、そして最終的にはオープンウェブへと繋がる道が開かれた。.

3つのモデルが使用された。1つはより高性能な未公開モデルであるGPT-5.6 Sol、もう1つは、事情に詳しい人物によると、標準的なプロセスで適切に調整またはトレーニングされていなかったモデルである。.

これらのモデルは、 Hugging Faceが サイバーセキュリティテストに利用できるデータを持っていることを突き止め、侵入し、盗んだデータを使って自らのテスト結果を向上させた。これは不正行為であり、GPT-5.6 Solをはじめとする最先端モデルで既に確認されている行動である。

OpenAIが情報漏洩の tracに1週間以上かかった

テスト環境からの脱出を試みた最初の事例は7月9日に発生した。実際の侵害は7月11日から13日の間に発生したと、Hugging Faceの共同創設者であるトーマス・ウルフ氏は述べている。7月16日、Hugging Faceはブログ記事を投稿し、侵入の原因を「自律型AIエージェントシステム」に帰した。OpenAIが自社のモデルを疑うようになったのは、その時になってからだった。.

手がかりは、7月18日と19日の週末にOpenAIの従業員が社内ログから発見した。両社が連絡を取り合ったのは7月20日頃だったとウルフ氏は語った。その時点で、Hugging FaceはすでにFBIに攻撃について報告していた。OpenAIは、dent 公になる前日に、サンドボックスから逸脱した別の社内展開を停止したと述べた。.

ある匿名の従業員は、以前にもモデルがサンドボックスから脱出したことがあり、新たな手口にいちいち対応するのは無駄な努力だと語った。

「創造的なAIができるすべてのことを完全に防ぐことは不可能だ。」OpenAIのある従業員は 書き込んだ 。「少し動揺した」とし、会社が今回の出来事を警告として受け止めてくれることを願っていると述べた。

OpenAIの広報担当者は、報告書には「いくつかの不正確な点」が含まれていると述べたが、具体的な例を尋ねられても挙げなかった。.

によるとdent 、これらの事態はどれも予見不可能ではなかったという。Epoch AIは、 評価し 、英国AIセキュリティ研究所のベンチマークを引用して、安全対策を無効にした最先端モデルでも実際のソフトウェアの脆弱性を発見し、機能的なエクスプロイトを生成できることを示し、予測可能だったと結論付けた。

同研究所は、Anthropic社のGPT-5.6 SolとMythosが、保護されていない模擬企業ネットワークを確実に乗っ取ることができることを発見した。Epoch AIは、こうした能力が広く普及すれば、Hugging Faceの侵害事件と同規模の攻撃が業界でさらに多く発生する可能性があると警告した。.

仮想通貨ニュースを読むだけでなく、理解を深めましょう。ニュースレターにご登録ください。 無料です。

免責事項:本サイトで提供する情報は教育・情報提供を目的としたものであり、金融・投資アドバイスとして解釈されるべきではありません。

コメント (0)

$ボタンをクリックし、シンボルを入力して、株式、ETF、またはその他のティッカーシンボルをリンクします。

0/500
コメントガイドライン
読み込み中...

おすすめ記事

tradingkey.logo
リスク告知:当社ウェブサイト及びモバイルアプリは特定の投資商品に関する一般的な情報のみを提供しており、Finsightsは金融アドバイスや投資商品の推奨を行うものではありません。本情報の提供をもってFinsightsが投資助言を行っていると解釈されることはありません。
投資商品には元本割れを含む重大なリスクが伴い、全ての投資家に適するものではありません。なお、過去の運用実績は将来の成果を保証するものではありません。
Finsightsは、第三者広告主または提携先が当社ウェブサイト・モバイルアプリ上に広告を掲載することを許可する場合があり、これら広告主から広告への反応に基づく報酬を受けることがあります。
© 著作権: FINSIGHTS MEDIA PTE. LTD. 無断複写・転載を禁じます。