Google reemplaza Gemini 3.6 Flash después de tres semanas, recorta los precios hasta fin de año
El equipo de Tulsee Doshi mejoró las puntuaciones de codificación y de flujo de trabajo, aunque la tabla completa de evaluación de Google muestra que las mejoras fueron desiguales.
By RuntimeWire Staff · Published
Primary source: Ars Technica
Why it matters
Google is turning frontier-model releases into rapid production iterations. The temporary discount makes testing cheap, while developers must judge 3.7 Flash at its higher January price.

Google DeepMind, el laboratorio de IA liderado por el cofundador Demis Hassabis, lanzó Gemini 3.7 Flash el 13 de agosto, reemplazando un modelo de trabajo que había estado en producción durante 23 días y aplicando una rebaja temporal de precio detrás de su impulso hacia los agentes de codificación.
El ciclo de lanzamiento comprimido corresponde a Tulsee Doshi, la directora sénior y jefa de producto de Google para el modelo Gemini. Doshi describió 3.7 Flash como el resultado de la retroalimentación de desarrolladores y cambios algorítmicos que Google espera llevar a modelos posteriores. Ars Technica informó que el despliegue llega mientras los desarrolladores siguen esperando Gemini 3.5 Pro, que Google dijo anteriormente que se estaba probando con socios.
Doshi ha pasado años en el punto donde la investigación de modelos se convierte en una decisión de producto. Antes de asumir la responsabilidad de la hoja de ruta de Gemini, dirigió el trabajo de producto de Responsible AI de Google durante cinco años. Estudió Symbolic Systems y ciencias de la computación en Stanford, una trayectoria académica que combinó el desarrollo técnico de sistemas de IA con preguntas sobre cómo las personas interactúan con ellos.
Su último lanzamiento trata a un modelo de vanguardia menos como un hito ocasional de investigación y más como software de producción sujeto a revisiones continuas. Google lanzó Gemini 3.6 Flash el 21 de julio, calificándolo como un reemplazo más barato y eficiente de 3.5 Flash. RuntimeWire informó en ese momento que Google mantenía 3.5 Pro en pruebas con socios mientras ya comenzaba su corrida de preentrenamiento para Gemini 4.
Tres semanas después, 3.7 Flash ha asumido el rol de modelo de trabajo.
Una actualización del modelo construida en torno a fallas de agentes
Google dice que Gemini 3.7 Flash se adapta mejor cuando un agente encuentra un obstáculo, pide aclaraciones de forma más efectiva y sigue instrucciones de múltiples pasos con menos reintentos. Esas mejoras atacan una debilidad costosa en los agentes de codificación: un modelo puede ser barato por token y aun así volverse caro cuando entra en bucles, edita los archivos equivocados o necesita correcciones humanas repetidas.
La guía para desarrolladores lista una ventana de contexto de 1 millón de tokens, una salida máxima de 64,000 tokens y niveles de pensamiento ajustables bajo, medio y alto. Gemini 3.7 Flash usa las mismas herramientas integradas que 3.6 Flash, limitando el trabajo de migración para desarrolladores que ya usan el modelo anterior.
La nueva versión se basa directamente en 3.6 Flash, según la ficha del modelo de Google. Google describe los cambios como mejoras algorítmicas en la base de razonamiento del modelo, más que una nueva arquitectura o un nuevo modelo base entrenado desde cero. Eso ayuda a explicar cómo el equipo de Doshi pasó de una versión numerada a la siguiente en 23 días.
Las ganancias reportadas por Google en codificación son sustanciales en varias pruebas. Gemini 3.7 Flash obtuvo 43.6% en FrontierCode 1.1 Main, frente al 34.4% de 3.6 Flash. Su puntuación DeepSWE v1.1 subió a 65.3% desde 48.6% en la ficha del modelo, mientras que su puntuación Elo en WebDev Arena aumentó a 1,588 desde 1,538.
Los resultados en flujos de trabajo empresariales avanzaron aún más. Google reportó un 30.4% en AutomationBench, comparado con 17% para 3.6 Flash, y un 34% en la prueba de comprensión de documentos GDP.pdf, desde 22%.
Estas siguen siendo evaluaciones reportadas por Google. Los materiales de lanzamiento no establecen cómo se traducirán esas puntuaciones en latencia, confiabilidad o costo total de la tarea dentro de sistemas de agentes en producción. Una tasa de completado más alta puede reducir reintentos, aunque los desarrolladores necesitarán probar ese efecto contra sus propios repositorios, herramientas y procesos de aprobación.
La tabla completa de Google es menos ordenada que el discurso de lanzamiento
La tabla de evaluación detallada muestra que 3.7 Flash no mejoró en todas las capacidades medidas. Su puntuación CharXiv sin herramientas, que evalúa el razonamiento sobre gráficos complejos, bajó a 84.5% desde 85.2%. Con herramientas, obtuvo 88.7%, comparado con 89.4% para 3.6 Flash.
Otras mejoras fueron modestísimas. El resultado en el benchmark de video largo LVBench subió a 85.4% desde 84.2%, mientras que la tasa de aprobación de Agent's Last Exam pasó a 26.3% desde 24.2%. La evidencia más fuerte de Google se sitúa en codificación, trabajo en terminal, procesamiento de documentos y automatización empresarial, las cargas de trabajo que el equipo de Doshi está apuntando explícitamente.
La ficha del modelo también enumera alucinaciones, lentitud ocasional y tiempos de espera entre las limitaciones conocidas del modelo. Indica que el corte de conocimiento de Gemini 3.7 Flash es marzo de 2026, con algunos dominios potencialmente limitados a información de enero de 2025. Las aplicaciones que dependan de información actual seguirán necesitando búsqueda, recuperación u otra fuente de datos en vivo.
Google dice que sus resultados de seguridad fueron ampliamente similares a los de 3.6 Flash. La compañía añadió salvaguardas para el uso indebido químico, biológico, radiológico, nuclear y cibernético, y afirmó que 3.7 Flash se mantuvo por debajo de los umbrales de capacidad crítica rastreados en su marco de seguridad para modelos de vanguardia.
El recorte de precio expira
Gemini 3.7 Flash cuesta $0.75 por millón de tokens de entrada y $3.75 por millón de tokens de salida hasta el 31 de diciembre. Google está aplicando las mismas tarifas promocionales a 3.6 Flash, reduciendo ambos modelos a la mitad del precio de lanzamiento original de 3.6 Flash.
El 1 de enero de 2027, las tarifas están programadas para subir a $1.50 por millón de tokens de entrada y $7.50 por millón de tokens de salida. Los desarrolladores que elijan 3.7 Flash por su economía de lanzamiento se enfrentan, por tanto, a un problema de planificación sencillo: las cargas de trabajo de producción deben funcionar al precio de enero, a menos que Google extienda la promoción o cambie la tarifa de nuevo.
El descuento temporal le da al equipo de Doshi cuatro meses y medio para empujar a los desarrolladores hacia el modelo, recopilar retroalimentación en producción y demostrar que menos bucles fallidos de agentes compensan el aumento de precio eventual. También permite a Google reducir el costo inmediato de probar 3.7 sin restablecer permanentemente el valor listado de su nivel Flash principal.
Gemini 3.7 Flash está generalmente disponible a través de la Gemini API, Google AI Studio, Android Studio, la plataforma de desarrollo Antigravity de Google y Gemini Enterprise. En la aplicación para consumidores, Google lo está usando inicialmente para impulsar Gemini Spark para suscriptores de AI Pro y Ultra en países compatibles. El chatbot estándar de Gemini permanece en 3.6 Flash, según Ars.
Esa elección de distribución pone el modelo primero en lugares donde llamadas repetidas a herramientas y flujos de trabajo de larga duración pueden generar un uso significativo. Gemini Spark puede consolidar archivos, redactar correos electrónicos y actualizar documentos de estado en Google Workspace, dando a Google un entorno controlado para medir si las mejoras en los benchmarks de 3.7 producen agentes que requieren menos supervisión.
Hassabis construyó DeepMind alrededor de un esfuerzo a largo plazo para entender y recrear la inteligencia. La tarea actual de Doshi es de ciclo más corto y operacional: convertir esa investigación en un modelo que los desarrolladores mantendrán en funcionamiento después de que desaparezca el precio introductorio. Enviar 3.7 Flash tres semanas después de 3.6 muestra lo rápido que Google puede revisar el producto. Los resultados en producción determinarán si la cadencia más rápida ahorra a los desarrolladores la misma cantidad de tiempo.