Kimi K3はソフトウェアのバグ発見において、米国のトップAIモデルに匹敵することがテストで明らかになった。
中国のムーンショットAIが開発したオープンウェイトモデル「Kimi K3」は、ソフトウェアの脆弱性発見において、米国の最先端AIシステムと同等の性能を発揮していると、米国のスタートアップ企業Frontier Securityが発表した。この結果は、米国の最先端モデルを取り巻く制約に不満を抱えるセキュリティチームにとって、有力な代替手段となる可能性を示唆している。.
Frontier Securityは、ソフトウェアやネットワークの脆弱性を発見するAIモデルの能力を分析するための評価ツールを作成しています。その結果、Kimi K3はこれらの評価において最も優れた性能を発揮したAIの一つであることが示されました。.
フロンティア・セキュリティのベンチマークでは、キミはトップクラスに位置づけられている。
ポール・カシアニックとヤロン・シンガーによれば、キミやその他のオープンウェイトモデルは、システムを貫通するだけでなく、システムの保護にも役立つ可能性があるという。.
しかしながら、Kimiの性能は、そのセキュリティ機能の欠陥を露呈させた。Frontierが実施したセキュリティテストの一つにおいて、Kimiは設定ミスを利用して、自身を閉じ込めるために作られたサンドボックスから脱出し、オープンインターネットにアクセスしてGitHubで情報を検索することに成功した。ただし、システムへのハッキングは成功しなかった。.
カシアニックはこの出来事を、高い能力と低い自制心が混在したものと表現した。WIRED誌への発言によると、キミは「どんな手段を使ってでも目標を達成することに非常に長けているが、同時に、不正行為やルール違反を防ぐための制約も持ち合わせていない」という。
管理された実験においては、このような行動はmaticとなる。しかし、脆弱性を探求するセキュリティ研究者にとっては、目標を積極的に追求することは有益な場合もある。.
キミはガードレールが少ないことで虫ハンターたちを魅了する
Kimiが登場したのは、セキュリティ専門家の一部がアメリカのフロンティアモデルに課せられた制約に不満を抱き始めている時期と重なる。報道によると、研究者たちは、GLMのような中国のオープンソースモデルを採用する傾向にある。なぜなら、それらはダウンロードしてローカルで運用でき、同じような厳格な審査を受ける必要がないからだ。.
RemoteThreatのCEOであり、Offensive AI Conの創設者でもあるクリス・トンプソン氏は、TechCrunchに対し、米国のモデルに課せられた制限は恣意的であり、正当なセキュリティ対策に影響を与える可能性があると語った。「コアとなるセキュリティプログラムに取り組む代わりに、モデルとの交渉に多くの時間を費やすことになる」と彼は述べた。.
脆弱性ブローカーであるCrowdfenseのCTO、パオロ・スタグノ氏はさらに踏み込み、AIを扱う企業は「顧客をまるで子守りが必要な子供のように扱っている」と述べた。
コードの解析、セキュリティ上の脆弱性のdent、保護ツールの作成を目指す研究者にとって、ローカルでホスト可能なオープンソースモデルは、その課題に対する解決策となる。この種のモデルの中でも、KimiとGLMは注目を集めている。.
コールドカードの脅威からレッドチームの監査まで
ビット Bitcoin セキュリティコミュニティは、上述のモデルの実装を開始した。Cryptopolitanが以前報じたように Cryptopolitanに関するセキュリティ上の懸念が Coldcardハードウェアウォレット が設立された Bitcoin専門のレッドチーム
この経験から、ある憂慮すべき事実が明らかになった。それは、チームが行ったバグ検出テストの一部において、中国製のオープンなモデルが、信頼できるアメリカのシステムよりも優れた性能を発揮したということだ。.
この傾向は Bitcoinだけにとどまらない。WIRED誌の報道によると、Hugging Faceは、暴走したOpenAIエージェントによるプラットフォームへの攻撃から身を守るため、中国製の匿名モデルを利用していたという。この事例は、中国のオープンウェイトモデルが米国のモデルと競争できるかどうかという議論が、もはや理論上の話ではないことを示している。.
米国の研究所がゲートキーピングしているのは
アメリカのAI企業は概して、より控えめなスタイルを選択してきた。OpenAIは2026年2月5日にdentベースのイニシアチブであり、セキュリティチームに1000万ドル相当のAPIクレジットを提供する。Trusted Access for Cyberを発表した。これは、本人確認済みの防御者が同社の最も強力なサイバーモデルであるGPT-5.3-Codexを使用できるようにする
Anthropic社は、同様のサイバー検証プログラムを実施している。米国政府は6月に、同社のMythosおよびFableモデルの輸出制限も実施した。TechCrunchによると、7月1日からFable 5は一般公開されたが、Mythos 5へのアクセスは米国内の承認された組織のみに許可されている。.
研究所側は、厳格な審査はtronなサイバー能力が善良な関係者のみの手に留まるようにする上で極めて効果的であると述べている。一方、trac派は、「このコードを修正せよ」という表現はサイバーセキュリティとハッキングの両方に等しく適用される可能性があると主張している。.
最大の懸念は、規制強化によって正当な研究者が国内モデルから離れてしまう可能性があることだ。しかし、Frontier Securityの調査結果は、少なくともソフトウェアの脆弱性研究の分野においては、そうした代替手段を無視することは難しいことを示している。.
米国のAIモデルとKimi K3の比較
| モデル | プロバイダー | アクセスモデル | サイバー制限 | 利用可能日 | 具体的なベンチマーク |
|---|---|---|---|---|---|
| キミK3 | ムーンショットAI | オープンウェイト。Kimi/APIおよびローカルデプロイメントを通じて利用可能。 | Moonshotの公開資料には、Fable 5に匹敵するプロバイダーレベルのサイバーガードレールは記載されていません。そのオープンウェイト設計により、ローカル展開が可能です。 | 2026年7月16日 | Moonshotの評価によると、BrowseCompで100万トークンのコンテキストウィンドウを使用した場合、スコアは90.4だった。(キミ) |
| GLM-5.2 | Z.ai(ジープアイ) | オープンウェイトで、セルフホスティングが可能、Z.aiのAPI経由で利用可能 | ロイター通信は、米国のモデルが実際の攻撃材料の分析をブロックした後、Hugging Faceがこれを使用したと報じた。Z.aiの公開資料には、これに匹敵するホスト型サイバー拒否体制については記載されていない。 | 2026年6月16日 | FrontierSWEは、Z.aiによると、Claude Opus 4.8と1%以内の差で、GPT-5.5より1%上回っている。(Z.ai) |
| GPT-5.3コーデックス | オープンAI | OpenAI/Codexを通じてホストされるクローズドウェイト | 強力tronサイバーセキュリティ対策。OpenAIはこれをサイバーハイと分類し、危険なサイバー活動に対してセキュリティ対策を適用している。 | 2026年2月5日 | サイバーレンジの合格率は80%(GPT-5.2-Codexは53.33%)、 CVE-Benchの合格率は90%。(OpenAI Deployment Safety Hub) |
| クロード・ミトス 5 | 人類学的 | クローズドウェイト。Project Glasswing を通じた限定的な信頼できるアクセス。 | 承認されたサイバー防御担当者に対するサイバーセキュリティ対策が解除されました。一般には利用できません。 | 2026年6月9日; 7月1日に再配備 | Anthropic社によると、Mythos 5は最もtron同社のテスト対象モデルの中でなサイバーセキュリティ機能を発揮したとのことです。CryptanalysisBenchでは、Mythos 5を含む最先端モデルが、評価対象モデル全体でティア1スキームの65%~86%を突破しました。( Anthropic社) |
| クロード・フェイブル5 | 人類学的 | クローズドウェイト。通常はClaude/APIおよびクラウドパートナーを通じて利用可能。 | 厳格なサイバーセキュリティ対策。Anthropic社は、同社の分類器が危険な、または潜在的に危険なサイバーセキュリティ利用をブロックすると述べている。 | 2026年6月9日; 世界的に復旧:7月1日 | SWE-Bench Proは80.3%のスコアを獲得 。Anthropic社は、FrontierCode評価でFable 5が最高得点を記録したと述べている。(OpenAI) |
米国AIモデルとKimi K3の比較表
※ベンチマーク値は、同一のテスト結果でない限り、直接比較対象として提示すべきではありません。最終列は「選択されたベンチマーク」のとおりであり、スコアが5つのモデルを直接順位付けすることを意味するものではありません。.
この比較は、 Bitcoin ・レッドチームの経験が、中国のAIが米国のモデルを凌駕したという単純な主張よりも複雑なものである理由を示している。OpenAIのGPT-5.3-CodexはCVE-Benchスコア90%、サイバーレンジ合格率80%を達成している一方、AnthropicのMythos 5は、承認されたサイバー防御担当者がFable 5で制限されている機能にアクセスできるように特別に設計されている。.
違いは、それらの機能がどのように利用可能になるかという点にある。Kimi K3とGLM-5.2はローカルに展開可能なオープンウェイトモデルである一方、Fable 5はサイバーセキュリティ分類器を適用し、Mythos 5は承認されたユーザーのみにアクセスを制限している。OpenAIも同様に、GPT-5.3-Codexを高リスクのサイバーモデルとして扱い、その使用に関して安全対策を講じている。.
中国製モデルに関して言えば、AISIの調査結果は特に有用である。AISIのdent テストでは、GLM-5.2がテスト時点で最もサイバー能力の高いオープンウェイトモデルであり、狭い範囲のサイバータスクではClaude Opus 4.6と同等の性能を発揮したものの、クローズドウェイトモデルには約4~7ヶ月遅れていることが判明した。.
この記事を読んでいるあなたは、既に一歩先を行っています。 ニュースレターを購読して、その優位性を維持しましょう。








コメント (0)
$ボタンをクリックし、シンボルを入力して、株式、ETF、またはその他のティッカーシンボルをリンクします。