グーグルが「Gemini 3.8 Flash」を投入:性能は最上位モデル「Claude Opus 5」に迫る、コスト効率が引き続き中核的競争力
グーグルは米東部時間9月2日、新モデル「Gemini 3.8 Flash」と「Gemini 3.8 Flash Cyber」を発表した。前者はコード生成や複雑な推論に特化し、主要ベンチマークで高価格帯モデルに匹敵する性能を低コスト(入力100万トークンあたり0.75ドル、出力3.75ドル)で実現している。後者はサイバーセキュリティの脆弱性発見と自動修復に特化し、審査済みの防御チーム限定で提供され、優れた検出成功率を記録した。両モデルは開発者や企業のエージェント導入や自動化における強力なコストパフォーマンスを提供する。

TradingKey - グーグル(GOOGL)は米東部時間9月2日、2つの新モデル「Gemini 3.8 Flash」と「Gemini 3.8 Flash Cyber」を発表しました。これはグーグルが6週間で発表した3番目のFlashシリーズモデルであり、前モデル「Gemini 3.7 Flash」の高速・低コストという特徴を継承しつつ、コード生成、複雑な推論、エージェントタスク、サイバーセキュリティ機能を一段と強化しています。
前者はソフトウェアエンジニアリング、AIエージェント、専門分野における多段階の推論タスク向けに位置付けられており、後者は脆弱性の発見と自動修復に特化し、審査を通過した信頼できる防御者にのみ提供されます。
両モデルは想定用途こそ異なるものの、いずれも同じ基盤知能コアをベースにしており、長時間実行されるエージェントループを通じてモデル出力を繰り返し評価・最適化します。
Gemini 3.8 Flash:ロングホライズンコーディングとエージェントタスクを強化
Gemini 3.8 Flashの主な強化点は、複数回にわたるツール呼び出し(マルチターン・ツール呼び出し)を必要とする複雑で継続的なタスクの処理にあります。グーグルは、特定のテストにおいて同モデルのパフォーマンスが、より高コストなフラッグシップモデルの性能に迫っていると発表しました。
長期実行型ソフトウェアエンジニアリングのベンチマークである「DeepSWE v1.1」において、Gemini 3.8 Flashは73.7%のスコアを記録し、Gemini 3.7 Flashの65.3%を上回ったほか、GPT-5.6 Solの72.7%やGPT-5.6 Terraの69.6%も超え、Claude Opus 5の74.0%をわずかに下回る水準にとどまりました。

出典:グーグル
専門分野のタスクにおいても、Gemini 3.8 Flashは高い競争力を示しました。その中でも、科学、技術、人文学、専門知識に及ぶ多分野の設問を網羅する「HLE-Verified」において、Gemini 3.8 FlashはClaude Sonnet 5の31.0%、GPT-5.6 Terraの51.1%、Claude Opus 5の54.4%、GPT-5.6 Solの54.5%を上回りました。
価格面では、Gemini 3.8 FlashはGemini 3.7 Flashの初期価格を維持しており、入力トークン100万個あたり0.75ドル、出力トークン100万個あたり3.75ドルとなっています。
これに対し、Claude Opus 5の入力・出力価格はそれぞれ5ドルと25ドル、GPT-5.6 Solは4ドルと20ドル、GPT-5.6 Terraは2ドルと12ドルとなっています。
これは、Gemini 3.8 Flashが特定のコーディングおよび推論のベンチマークにおいて大規模モデルに迫る、あるいはそれを上回る性能を発揮しながらも、API呼び出しコストが大幅に低いことを意味します。コードエージェント、自動分析、エンタープライズワークフローの導入を目指す開発者にとって、このコストパフォーマンスの高さが最大のアピールポイントとなる可能性があります。
Gemini 3.8 Flash Cyber:脆弱性発見と自動修復に特化
今回発表されたもう1つの主要モデルであるGemini 3.8 Flash Cyberは、主にサイバーセキュリティの防御シナリオを対象としています。グーグルは、同モデルを一般に広く提供するのではなく、新しいFairwindプログラムを通じて審査済みの信頼できる防御チームに提供すると述べています。
サイバーセキュリティ業界で広く利用されている脆弱性発見ベンチマーク「CyberGym」において、Gemini 3.8 Flash Cyberは86.2%のスコアを記録し、Gemini 3.5 Flash Cyberの77.5%を上回ったほか、GPT-5.6 Solの83.6%、Mythos 5の83.8%、GPT-5.5-Cyberの85.6%をも上回りました。
20種類のプログラミング言語を対象とした社内の現実的シナリオテストにおいて、Gemini 3.8 Flash Cyberは71.0%の脆弱性発見成功率を達成し、Gemini 3.7 Flashの58.9%やGemini 3.5 Flash Cyberの46.6%を上回りました。
自動修正に関しては、Collinearが実施したCWE-BenchテストでGemini 3.8 Flash Cyberは47.2%のpass@1を達成し、主要なトップレベルモデルの47.8%に迫る水準となりましたが、グーグルはそのコストの低さを強調しています。
このコンテンツはAIを使用して翻訳され、明確さを確認しました。情報提供のみを目的としています。
おすすめ記事













コメント (0)
$ボタンをクリックし、シンボルを入力して、株式、ETF、またはその他のティッカーシンボルをリンクします。