Google Cloud のページは Gemini の蒸留サービスについて説明しているが、リリース状況は不明だ。

アーカイブされたGoogleの文書は許可リスト限定のサービスを概説しているが、本番利用の禁止、矛盾するモデルID、未完成のツール類によりそのリリース状況は不明確なままである。

By · Published

Primary source: Google Cloud Documentation via Wayback Machine

Why it matters

Managed distillation could let AI companies serve specialized reasoning workloads at Flash-tier speed and cost without creating labeled answers, while tying training and deployment to Google Cloud.

an unconfirmed or incomplete data distillation service in a cloud environment (flat modernist vector illustration with subtle texture and overprint effects)

アーカイブされた Google Cloud ドキュメント ページ は、Gemini 3.1 Pro の出力と推論パターンを使用してカスタムの Gemini 2.5 Flash モデルをトレーニングする許可リスト方式のサービスについて説明しています。ページは7月23日に更新されたと記載していますが、その内容だけでは Google が正式に製品をローンチしたことを立証するものではありません。

文書には注意を促すいくつかの理由が含まれています。商用利用を禁じ、アクセスを許可リストに載ったプロジェクトに限定し、初期ユーザーには30日間のみアクセスを与えます。サポートされる teacher モデルとして gemini-3.1-pro を特定している一方で、サンプルの API リクエストでは gemini-3.1-pro-preview を使用している点もあります。コンソールは teacher がサンプルを生成している間の進行状況を表示しないと報告されており、チェックポイント表の epoch フィールドが既知の問題のためにゼロを示していることもあります。

これらの不整合がページがいたずらであることを証明するわけではありません。とはいえ、リリース状況は不明瞭であり、この文書だけをもって Google Cloud の一般提供(GA)された製品の確認とみなすべきではないことを示しています。

What the document claims

ページによれば、Gemini Distillation Service はモデル圧縮をマネージドなクラウドワークフローとしてパッケージ化するものです。顧客は Pro ティアのモデルを使ってトレーニング用のデータを生成し、より安価で高速な Flash モデルを学習させることで、繰り返し発生する大規模なワークロードに対するレイテンシと推論コストを削減できる可能性があります。

標準的な教師ありファインチューニングは、望ましい最終回答を含むラベル付きの例に対してモデルを訓練するのが一般的です。文書で説明される distillation ワークフローでは代わりにプロンプトのみのデータセットをアップロードでき、Gemini 3.1 Pro が回答を生成し、Gemini 2.5 Flash がその teacher モデルの応答と文書が「raw thoughts」(内部の推論経路)と呼ぶものから学習します。

このワークフローは手作業で大量の正解セットを構築する必要性を減らす可能性があります。文書は、顕著な改善を得るには少なくとも1,000件の多様なプロンプトを推奨しており、サービスは最大50,000件の例を最大1GBの JSONL ファイルで受け付けると記載しています。

各例は8,000入力トークンに制限されています。データセットのうち10%を超える例がその閾値を超えた場合、Google はジョブを終了するとページは述べています。Teacher の出力は24,000トークンで上限が設けられており、それを超える部分は切り捨てられるため、student モデルの性能が低下する可能性があります。

記載されたサービスはテキストのみをサポートします。画像、ビデオ、function calls は除外されており、初期利用は技術文書の要約、複雑なコーディング、その他の多段階の推論タスクのように、Google がベースの Flash モデルが Pro に遅れを取るとするワークロードに限定されます。

文書は、teacher のサンプリングと student のトレーニングが単一の Agent Platform API 呼び出しを通じて us-central1 リージョンで実行されると述べています。完成したモデルは Gemini Enterprise Agent Platform Model Registry に登録され、評価用の予測エンドポイントと中間チェックポイントが作成されます。顧客は同じベースの student モデルを維持していれば、以前に蒸留したチェックポイントの訓練を継続できます。

A potentially deeper tie to Google's AI stack

もし真実であり、記載どおりにリリースされれば、このサービスは4月22日に Vertex AI の後継として Google が導入した Gemini Enterprise Agent Platform を拡張することになります。Google は将来の Vertex サービスとロードマップの更新が改名されたプラットフォーム経由で移行すると述べており、そのプラットフォームはモデル開発、エージェントのデプロイ、アイデンティティ、ガバナンス、評価、可観測性を組み合わせています。

Distillation はカスタマイズのサイクルをそのスタック内に留める別の手段を Google に提供します。顧客プロンプトは Cloud Storage に残り、teacher の推論と student のトレーニングは Google の API を通じて実行され、完成したモデルは Google のレジストリとサービングインフラに格納されます。

モデルの組み合わせは、最先端モデルと小型モデルとの間のコスト差も反映しています。すべてのリクエストを Gemini 3.1 Pro に送る代わりに、企業は大きなモデルを使って専門化されたトレーニングセットを生成し、繰り返されるワークロードは Gemini 2.5 Flash で提供することができます。student が teacher の性能を十分に保持するかどうかはワークロードごとに異なります。文書は、保留したテストセットを用いて元の Flash モデルと Gemini 3.1 Pro の両方と比較することを求めています。

ページはこのサービスを Google の Pre-GA Offerings Terms の下に位置付けており、その下では製品は現状のままで提供され、サポートが限定される場合があるとされています。創業者や運用者にとって、商用利用禁止、限定的なモデルの組み合わせ、リージョン制限、文書上の不整合は、Google がそのステータスを明確にするまでは監視すべき事柄であり、それを基盤にサービスを構築するほどではないことを意味します。

Reader comments

Conversation for this story loads after sign-in.