虎嗅

**Gemini3.8の突然のアップデート――深夜にも及ぶ変更!グーグルは一体何を急いでいるのか?**

原文:Gemini3.8 Flash深夜突袭,六周三更,谷歌到底在急什么?

核要内容のまとめ

Googleはわずか6週間の間にGemini Flashシリーズの大型モデルを3つ連続で発表しました。最新の3.8 Flashは「安価」な価格(入力0.75ドル/百万Token、出力3.75ドル)であり、スコアデータも優れています(プログラミングではClaude Opus 5に匹敵し、推論ではGPT-5.6 Solを上回っています)。また、セキュリティに特化したCyber版もリリースされました。しかし、実際の使用においては、一般ユーザーから「スコアは良いものの実用性に欠ける」との声が上がっています。公式デモンストレーションでは特殊な設定が必要であり、長時間の処理に耐えられず、細部の処理も粗雑です。その背景には、GoogleのフラッグシップモデルであるGemini Proの開発が遅れており、核心的な技術者が流出していることがあります。そのため、市場での存在感を維持するために、Flashのような小型モデルを使って「小さなステップで迅速に進む」しかないのです。

1. 安価ながら高性能な「スコアの優秀なモデル」

3.8 FlashはGoogleによって「最も賢いFlashモデル」と評されており、長期間のプログラミングや複雑な推論、専門的なエージェントシナリオに特化していますが、価格は前モデルの3.7 Flashと同じです。

  • プログラミング能力はほぼ限界に達している:DeepSWEの長期プログラミングテストでは73.7%のスコアを記録し、Claude Opus 5(74%)に匹敵しましたが、コストは後者の5分の1(問題あたり2.36ドル対11.84ドル)です。Terminal-Bench 2.1テストでは89.4%を獲得し、Flashクラスのモデルとして初めて90%に迫りました。
  • 学際的な推論能力もトップクラス:STEMや人文科学を含む「ヒューマン・エクストリーム・テスト(HLE)」では54.9%のスコアを記録し、Opus 5(54.4%)やGPT-5.6 Sol(54.5%)を上回りました。
  • 専門シナリオではフラッグシップモデルを上回る:金融エージェントテスト(Vals V2)では61.4%のスコアを記録し、GPT-5.6 Sol(53.8%)を上回りました。法律エージェントテスト(Harvey)では合格率が10%で、Opus 5の1.5倍です。
  • Cyber版はセキュリティに特化:脆弱性の発見率は86.2%(GPT-5.5-Cyberを上回り)、脆弱性の修正コストも低く、Chromeチームが生成した正しいパッチは他のモデルの2.6倍の効果がありますが、「信頼できる防御者」にのみ提供されています。

その秘密は、3.8 Flashが難しい問題に直面したときに「より多くのステップを考える」ことにあります。例えば、プログラミングタスクでは3.7 Flashよりも3.6万Token多く出力し、41ステップ多く実行します。複雑なタスクの実際のコストはわずかに上がりますが(0.4ドルから0.58ドル)、全体としてはフラッグシップモデルよりもはるかに安価です。

2. 実際の使用感では期待に反する

公式デモンストレーションでは3.8 Flashが3Dの城を作ったり、DOS版のGoogleマップを操作したりできますが、一般ユーザーが実際に使用すると大きな差があります:

  • 設定の差:公式デモンストレーションではAntigravityプラットフォームやNano Bananaを使用してテクスチャを生成していますが、一般ユーザーが使用するのは基本的なモデルです。例えば、Three.jsを使ってエアバスのヘリコプターを作ると、109秒で結果が出ますが、機体のパーツが粗雑で動きが不自然です。3Dの火山口のシミュレーションでも問題があります。
  • 速度は速いが品質が低い:Sticky Ballゲームを行うと、Flashは速く動きますが、Kimi K3ほどの動きや表現力はありません。ニューヨーク市の市場シナリオテストでは、3.7 Flashの10本の木に対して6本しか使用されておらず、横断歩道や水中のボケ効果などが省略されています。また、カメラの設定や後処理のオプションが無秩序に追加されています。
  • 長時間の処理に耐えられない:Terminal-Bench 4.0(より難しいタスク)では19.1%のスコアにとどまり(Opus 5は51.8%)、OSWorldのコンピュータ操作テストでは59%(Opus 5は75.4%)です。総合的な知能ランキングでは8位ですが、コードのスキルは高いものの、異分野の長時間のタスクでは限界が露呈しています。

3. 3つのモデルを急いでリリースした背景にある事情

GoogleがFlashを急いでリリースしたのは、技術的なブレークスルーがあったからではなく、やむを得ない状況からです:

  • フラッグシップモデルの開発が遅れている:今年の5月にPichaiは新しいProバージョンが「1ヶ月後にリリースされる」と発表しましたが、その後3.5 Proの計画はキャンセルされました(性能向上がFlashに及ばなかったため)。Gemini 4も後期のトレーニング段階で停滞しており、発売はまだ先です。
  • 核心的な技術者の流出:過去1ヶ月半でNoam Shazeer(大型モデルの先駆者)やJeff Dean(Google AIの中心人物)などが次々と退職し、組織が不安定になっています。新しい経営陣は「リリース速度の加速」を要求しています。
  • Flashは緊急対策:Flashモデルは規模が小さく、修正やトレーニングに必要な計算能力もProシリーズよりもはるかに低いため、複数のチームが同時に異なるアプローチを試すことができ、3週間で1回のイテレーションが可能です。Proシリーズの調整にはより多くのGPUと時間が必要で、試行錯誤のコストが高いです。

したがって、3つのFlashモデルのリリースは「小さなステップで大きな目標を達成する」ためのものです。フラッグシップモデルの開発が遅れているため、Flashを使って市場での存在感を維持し、OpenAIやAnthropicなどの競合他社に追い越されないようにしています。

4. Flashの実際の位置づけ

FlashはGoogleの最終目標ではありませんが、現時点で最も実用的な手段です:

  • 完全なフラッグシップモデルではない:実際の使用で明らかになった問題から、本当のフラッグシップ級のモデルとはまだ差があります(長時間のタスクに弱く、細部の処理が粗雑です)。
  • しかし、緊急時には十分に役立つ:安価でイテレーションが速く、特定のシナリオ(プログラミング、金融エージェント)ではフラッグシップモデルに匹敵する性能を持っています。これにより、ProやGemini 4がリリースされるまでの間、市場シェアと開発者の関心を維持することができます。

簡単に言えば、FlashはGoogleの「過渡的な手段」です。最終的な勝利を収めるにはフラッグシップモデルが必要ですが、現在はそれに頼って「場を保つ」ためのものです。大規模なモデルの競争では、誰も足を止めることができず、「小さなステップで迅速に進む」ことで存在感を維持しています。

総括

GoogleのFlashシリーズは「コストパフォーマンスに優れたモデル」と言えます。特定の分野(プログラミング、金融)では優れた性能を発揮しますが、総合的な能力(長時間のタスク、細部の処理)ではフラッグシップモデルには及びません。3つのモデルを急いでリリースした背景には、フラッグシップモデルの開発が遅れており、核心的な技術者が流出しているという事情があります。小規模なモデルを迅速にイテレーションすることで、市場での存在感を維持しています。