La página de Google Cloud describe el servicio de destilación Gemini, pero su estado de lanzamiento no está claro
Un documento archivado de Google describe un servicio exclusivamente para listas de permitidos, pero una prohibición en producción, identificadores de modelo conflictivos y herramientas incompletas dejan incierto su estado de lanzamiento.
By Ryan Merket · Published
Primary source: Google Cloud Documentation via Wayback Machine
Why it matters
Managed distillation could let AI companies serve specialized reasoning workloads at Flash-tier speed and cost without creating labeled answers, while tying training and deployment to Google Cloud.

Una página archivada de documentación de Google Cloud describe un servicio en la lista de permitidos que usaría las salidas y los patrones de razonamiento de Gemini 3.1 Pro para entrenar modelos personalizados Gemini 2.5 Flash. La página indica que fue actualizada el 23 de julio, pero su contenido no establece que Google haya lanzado formalmente el producto.
El documento contiene varias razones para la precaución. Prohíbe el uso en producción, limita el acceso a proyectos en la lista de permitidos y da a los usuarios iniciales solo 30 días de acceso. También identifica gemini-3.1-pro como el modelo docente compatible mientras que sus solicitudes de API de ejemplo usan gemini-3.1-pro-preview. Según se informa, la consola no muestra el progreso mientras el docente genera muestras, y una tabla de puntos de control muestra cero en un campo de época debido a un problema conocido.
Esas inconsistencias no prueban que la página sea una broma. Sí hacen que el estado de lanzamiento sea poco claro y argumentan en contra de tratar el documento por sí solo como confirmación de un producto de Google Cloud disponible generalmente.
Qué afirma el documento
Según la página, Gemini Distillation Service empaqueta la compresión de modelos como un flujo de trabajo administrado en la nube. Los clientes usarían un modelo de la categoría Pro para generar material de entrenamiento para un modelo Flash más barato y rápido, lo que potencialmente reduciría la latencia y los costos de inferencia en cargas de trabajo repetidas y de alto volumen.
El ajuste fino supervisado estándar típicamente entrena un modelo contra ejemplos etiquetados que contienen la respuesta final deseada. El flujo de trabajo de destilación documentado, en cambio, permite que un cliente cargue un conjunto de datos que solo contiene prompts. Gemini 3.1 Pro entonces genera respuestas, y Gemini 2.5 Flash aprende de las respuestas del modelo docente y de lo que la página llama sus "pensamientos en bruto", o rutas internas de razonamiento.
El flujo de trabajo podría reducir la necesidad de construir manualmente grandes conjuntos de respuestas de referencia. El documento recomienda al menos 1,000 prompts variados para producir una mejora notable y dice que el servicio acepta hasta 50,000 ejemplos en un archivo JSONL de no más de 1 GB.
Cada ejemplo está limitado a 8,000 tokens de entrada. La página dice que Google terminará un trabajo si más del 10% del conjunto de datos excede ese umbral. Las salidas del docente están limitadas a 24,000 tokens y se truncarán más allá de ese punto, lo que podría reducir el rendimiento del modelo alumno.
El servicio descrito admite solo texto. Imágenes, video y llamadas a funciones están excluidos, limitando su uso inicial a cargas de trabajo como el resumen de documentos técnicos, codificación compleja y otras tareas de razonamiento en varios pasos donde Google dice que el modelo base Flash queda rezagado respecto a Pro.
El documento dice que el muestreo del docente y el entrenamiento del alumno se ejecutan mediante una única llamada a la Agent Platform API en la región us-central1. Los modelos completados se registran en el Gemini Enterprise Agent Platform Model Registry, con endpoints de predicción y puntos de control intermedios creados para evaluación. Los clientes pueden continuar entrenando un punto de control destilado previamente si conservan el mismo modelo base alumno.
Un vínculo potencialmente más profundo con la pila de IA de Google
Si es genuino y se lanza tal como se describe, el servicio ampliaría Gemini Enterprise Agent Platform, que Google presentó el 22 de abril como sucesor de Vertex AI. Google dijo que futuros servicios de Vertex y actualizaciones de la hoja de ruta se moverían a través de la plataforma renombrada, que combina desarrollo de modelos, despliegue de agentes, identidad, gobernanza, evaluación y observabilidad.
La destilación daría a Google otra forma de mantener el ciclo de personalización dentro de esa pila. Los prompts de los clientes permanecerían en Cloud Storage, la inferencia del docente y el entrenamiento del alumno se ejecutarían a través de la API de Google, y los modelos completados aterrizarían en el registro e infraestructura de serving de Google.
La pareja de modelos también refleja la brecha de costos entre modelos de frontera y modelos más pequeños. En lugar de enviar cada solicitud a Gemini 3.1 Pro, una empresa podría usar el modelo más grande para generar un conjunto de entrenamiento especializado y servir cargas de trabajo repetidas mediante Gemini 2.5 Flash. Si el alumno retiene suficiente del rendimiento del docente seguiría siendo específico de la carga de trabajo. El documento pide comparaciones tanto contra el modelo Flash original como contra Gemini 3.1 Pro usando un conjunto de prueba separado.
La página ubica el servicio bajo los Pre-GA Offerings Terms de Google, bajo los cuales los productos se proporcionan tal cual y pueden recibir soporte limitado. Para fundadores y operadores, la prohibición de producción, el emparejamiento de modelos restringido, la restricción regional y las anomalías en la documentación hacen de esto algo para monitorear, no un servicio en torno al cual construir hasta que Google aclare su estatus.