Google、3週間でGemini 3.6 Flashを置き換え、年末まで価格を引き下げ

Tulsee Doshiのチームはコーディングとワークフローのスコアを改善したが、Googleの完全な評価表はその改善が一貫していなかったことを示している。

By · Published

Primary source: Ars Technica

Why it matters

Google is turning frontier-model releases into rapid production iterations. The temporary discount makes testing cheap, while developers must judge 3.7 Flash at its higher January price.

Illustration of Google replacing Gemini 3.6 Flash, showing the model's old structure fragmenting as newer, optimized components integrate

Google DeepMind、共同設立者のDemis Hassabis(デミス・ハサビス)が率いるAI研究所は8月13日にGemini 3.7 Flashをリリースしました。これは23日間稼働していた主力モデルに取って代わるもので、コーディングエージェントへの取り組みを後押しするための一時的な価格引き下げを伴っています。

短いリリースサイクルは、Geminiモデルのプロダクト責任者でありGoogleのシニアディレクターであるTulsee Doshiに起因します。Doshiは3.7 Flashを開発者のフィードバックと、Googleが後続モデルにも持ち込むと期待しているアルゴリズム的変更の結果だと説明しました。Ars Technicaは報じましたが、この展開は開発者が以前にGoogleがパートナーとともにテスト中だと述べていたGemini 3.5 Proを待ち続けている中で行われています。

Doshiは、モデル研究が製品判断へと移行する地点に長年携わってきました。Geminiのロードマップを担当する前は、5年間にわたりGoogleのResponsible AIプロダクト業務を率いていました。彼女はスタンフォード大学でSymbolic Systemsとコンピュータサイエンスを学び、AIシステムの技術的開発と人々のそれらとの相互作用に関する問いを組み合わせる学問的経路を歩みました。

彼女の最新リリースは、フロンティアモデルを時折の研究上のマイルストーンとして扱うのではなく、継続的に改訂される運用ソフトウェアに近い扱いにしています。Googleは7月21日にGemini 3.6 Flashを発売し、それを3.5 Flashのより安価で効率的な代替と呼びました。RuntimeWireは当時報じたとおり、Googleは3.5 Proをパートナーテストに残しつつ、すでにGemini 4のプレトレーニングを開始していました。

3週間後、3.7 Flashが主力の役割を引き継ぎました。

エージェントの失敗を中心に構築されたモデル更新

Googleによれば、Gemini 3.7 Flashはエージェントが行き詰まったときにより適応しやすく、明確化をより効果的に求め、複数ステップの指示をより少ない再試行で実行するといいます。これらの改善は、コーディングエージェントにとってコストのかかる弱点を狙ったものです:モデルはトークンあたりのコストが安くても、ループしたり誤ったファイルを編集したり何度も人手で修正が入ると高コストになります。

開発者ガイドでは100万トークンのコンテキストウィンドウ、最大出力64,000トークン、低・中・高の思考レベルを調整可能としています。Gemini 3.7 Flashは3.6 Flashと同じ組み込みツールを使用しており、既に古いモデルを使用している開発者の移行作業を制限します。

Googleのモデルカードによれば、新バージョンは3.6 Flashを直接ベースにしており、変更は新しいアーキテクチャやスクラッチから訓練した新たなベースモデルではなく、モデルのコア推論基盤に対するアルゴリズム的改善として説明されています。これが、Doshiのチームが23日で次の番号付きリリースへ移行できた理由の一端を説明します。

Googleが報告するコーディングの改善は複数のテストで大きなものです。Gemini 3.7 FlashはFrontierCode 1.1 Mainで43.6%を記録し、3.6 Flashの34.4%から上昇しました。モデルカードによればDeepSWE v1.1のスコアは48.6%から65.3%に上がり、WebDev ArenaのEloスコアは1,538から1,588に増加しました。

エンタープライズワークフローの結果もさらに進展しました。GoogleはAutomationBenchで30.4%を報告しており、3.6 Flashの17%から改善しています。またGDP.pdfドキュメント理解テストでは22%から34%に上昇しました。

これらは依然としてGoogleが報告した評価です。発表資料は、スコアがプロダクションのエージェントシステム内でのレイテンシ、信頼性、あるいはタスク全体のコストにどのように変換されるかを確立していません。完了率の向上は再試行を減らす可能性がありますが、開発者は自分たちのリポジトリ、ツール、承認プロセスに対してその効果をテストする必要があります。

発表の体裁ほどには整っていないGoogleの詳細表

詳細な評価表は、3.7 Flashがすべての測定能力で改善したわけではないことを示しています。複雑なグラフに対する推論をテストするツール無しのCharXivスコアは85.2%から84.5%に低下しました。ツールありでは88.7%で、3.6 Flashの89.4%と比べてわずかに低くなっています。

その他の改善は小幅です。長尺ビデオのLVBenchは84.2%から85.4%に上がり、Agent's Last Examの合格率は24.2%から26.3%に移動しました。Googleの最も強いエビデンスは、Doshiのチームが明示的にターゲットとしているコーディング、ターミナル作業、ドキュメント処理、ビジネスオートメーションの分野にあります。

モデルカードはまた、ハルシネーション(誤生成)、時折の遅延、タイムアウトをモデルの既知の制約として挙げています。知識のカットオフは2026年3月とされ、一部の領域では2025年1月時点の情報に限られる可能性があるとされています。最新情報に依存するアプリケーションは、検索、情報検索、あるいは別のライブデータソースを引き続き必要とします。

Googleは安全性の結果は3.6 Flashと概ね同様だと述べています。化学、生物、放射線、核、サイバーの誤用に対する保護策を追加し、3.7 Flashはフロンティア安全フレームワークで追跡される重要な能力閾値を下回っているとしています。

価格引き下げは期限付き

Gemini 3.7 Flashは入力100万トークンあたり$0.75、出力100万トークンあたり$3.75で12月31日まで提供されます。Googleは同じプロモーション料金を3.6 Flashにも適用しており、両モデルを3.6 Flashの当初の発売価格の半額に引き下げています。

2027年1月1日には料金は入力$1.50、出力$7.50に引き上げられる予定です。したがって、ローンチ時の経済性を理由に3.7 Flashを選ぶ開発者は単純な計画上の問題に直面します:本番ワークロードは、Googleがプロモーションを延長するか再び料金を変更しない限り、1月の価格で動作する必要があります。

この一時的な割引により、Doshiのチームには開発者をモデルに移行させ、本番でのフィードバックを収集し、失敗したエージェントループが減ることで最終的な価格上昇を相殺できることを示すための4カ月半が与えられます。また、3.7をテストするための即時コストを下げつつ、主要なFlash階層の表示価格を永久にリセットしないことも可能にします。

Gemini 3.7 FlashはGemini API、Google AI Studio、Android Studio、GoogleのAntigravity開発プラットフォーム、Gemini Enterpriseを通じて一般提供されています。消費者向けアプリでは、Googleは対応国のAI ProおよびUltra加入者向けにまずGemini Sparkの動力源として使用しています。標準のGeminiチャットボットはArsによれば3.6 Flashのままです。

その配布の選択は、繰り返されるツール呼び出しや長時間実行されるワークフローが意味のある使用量を生む場所でモデルを優先します。Gemini Sparkはファイルの統合、メールの下書き、Google Workspace全体のステータス文書の更新を行うことができ、3.7のベンチマーク上の改善が監督を少なくするエージェントを生むかどうかを測定するための管理された環境をGoogleに提供します。

Hassabisは知性を理解し再現する長期的な努力の周りにDeepMindを築きました。Doshiの現在の任務はより短期で運用的です:導入時の価格が消えた後も開発者が稼働し続けるモデルへとその研究を変換することです。3.6の3週間後に3.7 Flashを出荷したことは、Googleが製品をどれだけ速く改訂できるかを示しています。本番での結果が、より速いサイクルが開発者に同じ量の時間節約をもたらすかどうかを決定するでしょう。

Reader comments

Conversation for this story loads after sign-in.