Google Cloud 页面描述了 Gemini 的蒸馏服务,但其发布状态不明确

一份已存档的 Google 文档概述了一个仅允许列表的服务,但禁止用于生产环境、模型 ID 冲突和未完成的工具使其发布状态不明确。

By · Published

Primary source: Google Cloud Documentation via Wayback Machine

Why it matters

Managed distillation could let AI companies serve specialized reasoning workloads at Flash-tier speed and cost without creating labeled answers, while tying training and deployment to Google Cloud.

an unconfirmed or incomplete data distillation service in a cloud environment (flat modernist vector illustration with subtle texture and overprint effects)

一个已存档的 Google Cloud 文档页面 描述了一个允许列入白名单的服务,该服务将使用 Gemini 3.1 Pro 的输出和推理模式来训练定制的 Gemini 2.5 Flash 模型。该页面写着更新于 7 月 23 日,但其内容并不能证明 Google 已正式发布该产品。

该文档包含若干需谨慎对待的理由。它禁止用于生产用途,限制访问仅限列入白名单的项目,并且仅向初始用户提供 30 天的访问权限。文档还将 gemini-3.1-pro 标识为受支持的 teacher 模型,但其示例 API 请求使用的是 gemini-3.1-pro-preview。据称控制台在 teacher 生成样本时并不显示进度,检查点表中的 epoch 字段显示为零,因这是一个已知问题。

这些不一致并不能证明该页面是一个恶作剧。但它们确实使发布状态变得不明朗,并且反对仅凭这份文档就将其视为 Google Cloud 一项普遍可用产品的确认。

文档声称的内容

据该页面所述,Gemini Distillation Service 将模型压缩打包为一个托管的云工作流。客户将使用 Pro 级模型生成训练材料,以便训练更便宜、更快速的 Flash 模型,从而在重复、高流量的工作负载中潜在地降低延迟和推理成本。

标准的监督微调通常基于包含期望最终答案的带标签示例来训练模型。所述的蒸馏工作流则允许客户上传仅含提示(prompt-only)的数据集。Gemini 3.1 Pro 随后生成答案,Gemini 2.5 Flash 则从 teacher 模型的响应以及页面所称的“raw thoughts”(或内部推理路径)中学习。

该工作流可减少手工构建大量真实答案集的需求。文档建议至少使用 1,000 个多样化提示以产生明显改进,并表示该服务接受最多 50,000 个示例,格式为 JSONL 文件且不超过 1 GB。

每个示例的输入限制为 8,000 个 token。页面表示,如果数据集中超过 10% 的示例超出该阈值,Google 将终止该作业。teacher 的输出上限为 24,000 个 token,超出该点会被截断,这可能会降低 student 模型的性能。

所述服务仅支持文本。图像、视频和函数调用被排除在外,这限制了其最初的用例为诸如技术文档摘要、复杂编码和其他多步推理任务等场景,Google 表示在这些场景中基础 Flash 模型落后于 Pro。

文档表示 teacher 抽样和 student 训练通过单个 Agent Platform API 调用在 us-central1 区域运行。完成的模型会在 Gemini Enterprise Agent Platform Model Registry 中注册,并为评估创建预测端点和中间检查点。如果客户保留相同的基础 student 模型,他们可以继续训练先前蒸馏得到的检查点。

与 Google 的 AI 堆栈可能更深的关联

如果该服务属实并按所述发布,它将扩展 Gemini Enterprise Agent Platform,Google 于 4 月 22 日将其作为 Vertex AI 的继任者推出。Google 表示未来的 Vertex 服务和路线图更新将通过重命名的平台迁移,该平台结合了模型开发、agent 部署、身份、治理、评估和可观测性。

蒸馏将为 Google 提供另一种将定制化周期保持在该堆栈内部的方式。客户提示将保留在 Cloud Storage,teacher 推理和 student 训练将通过 Google 的 API 运行,完成的模型将落在 Google 的注册表和服务基础设施中。

这种模型配对也反映了前沿模型与小型模型之间的成本差距。公司可以不必将每个请求都发送到 Gemini 3.1 Pro,而是使用更大的模型生成一个专门的训练集,并通过 Gemini 2.5 Flash 服务重复性工作负载。student 是否能保留足够的 teacher 性能将取决于具体工作负载。文档建议使用保留的测试集对比原始 Flash 模型和 Gemini 3.1 Pro 进行比较。

该页面将该服务置于 Google 的 Pre-GA Offerings Terms 下,根据该条款,产品按现状提供并可能获得有限支持。对于创始人和运营者来说,生产使用禁令、狭窄的模型配对、区域限制和文档异常使其成为值得监视的项目,而不是在 Google 澄清其状态之前就围绕该服务构建的目标。

Reader comments

Conversation for this story loads after sign-in.