La demostración de mayo de Gemini Omni Flash de Ashutosh Shrivastava agotó un límite de cinco horas

La demostración del 25 de mayo de Ashutosh Shrivastava mostró a Gemini Omni Flash generando un video de avatar personal, mientras que un solo comando presuntamente agotó el límite de uso de cinco horas.

By · Published

Primary source: Aligned News - AI Intelligence

Why it matters

Google put personal-avatar video inside Gemini and planned availability for YouTube Shorts and YouTube Create. Shrivastava's test showed that failed generations and compute limits could still keep the feature from becoming a dependable production workflow.

Gemini Omni Flash turns a creator into a promptable video avatar

El 25 de mayo de 2026, el consultor de IA y creador tecnológico Ashutosh Shrivastava publicó un clip de Gemini Omni Flash que mostraba una versión sintética de sí mismo presentando un video generado a partir de un prompt. La demostración expuso un producto útil dentro del amplio argumento de Google para un modelo que puede crear "cualquier cosa a partir de cualquier entrada": grábate una vez, escribe un prompt y envía una versión sintética de ti frente a la cámara.

Ashutosh Shrivastava en X

Shrivastava es consultor de IA y creador tecnológico, no un empleado de Google. Su sitio web indica que ha trabajado con más de 150 clientes y participa en programas de acceso anticipado para Gemini y otros productos de medios generativos. Eso lo hace parte de una capa de distribución cada vez más importante para los laboratorios de IA: creadores que prueban productos incompletos, identifican el caso de uso comprensible y ponen un rostro humano a capacidades difíciles de explicar en una ficha de modelo. (Ashutosh Shrivastava)

En el caso de Shrivastava, el rostro humano es también la entrada del producto. El flujo de trabajo de avatar de Google pide al usuario que grabe una muestra corta de su rostro y voz, y luego seleccione ese avatar personal dentro de un prompt de Gemini. En Gemini Apps, la creación de avatares requiere que los usuarios tengan al menos 18 años y hayan iniciado sesión en una Cuenta de Google personal con un plan Google AI. Los usuarios elegibles de Google Workspace también pueden usar avatares personales en Google Vids. La generación de video con cuenta personal en Gemini Apps requiere un plan Google AI, mientras que las cuentas de trabajo o escolares requieren una licencia calificada de Google Workspace. (Google Gemini Apps Help)

Un modelo de video amplio encuentra un trabajo específico

Google introdujo Gemini Omni Flash el 19 de mayo de 2026, como el primer modelo de su familia Gemini Omni. El modelo acepta combinaciones de texto, imágenes, audio y video, y luego genera videos cortos con audio. Los usuarios pueden solicitar cambios en objetos, acciones, posición de cámara, ambiente y estilo mediante una conversación continua. Google comenzó a desplegarlo a través de la app de Gemini y Google Flow. Google dijo que estaba planeada la disponibilidad para YouTube Shorts y YouTube Create. (Google)

La capacidad de avatar es un flujo de trabajo dentro de Gemini Apps, en lugar de un producto anunciado por separado llamado "Gemini Avatar". Esa distinción importa porque la ventaja de Google proviene de combinar varios modos de creación dentro de productos que ya distribuye. Un usuario puede suministrar su propia identidad, generar una escena y seguir editándola mediante prompts sin pasar a un servicio de video de presentador dedicado.

Especialistas han construido soluciones alrededor de versiones más acotadas de este trabajo. Avatar IV de HeyGen anima una sola imagen con habla sincronizada, movimiento facial y gestos de manos. Synthesia empaqueta avatares con guiones, traducción, controles de marca y colaboración para video empresarial. El modelo de Google está menos pensado para un único propósito. Su propuesta abarca avatares personales junto con generación cinematográfica, edición de video y referencias multimodales. (HeyGen)

Esa amplitud le da a Google varias rutas al mercado, pero el clip de Shrivastava es un argumento de venta más claro que la frase "cualquier cosa a partir de cualquier entrada". Fundadores y pequeños equipos de marketing pueden entender a un presentador digital reutilizable. Podría convertir un guion en una actualización de producto, una prueba de localización o un clip social sin otra sesión de grabación. La demostración no establece que el flujo de trabajo sea lo bastante confiable como para reemplazar un proceso de producción.

La misma prueba expuso el costo de llegar ahí

El 26 de mayo, Shrivastava informó que un prompt para video con avatar se ejecutó durante aproximadamente cuatro minutos, consumió todo su cupo de uso de Gemini de cinco horas e inicialmente no produjo un video, según ComputerBase. El informe dijo que el clip se completó después de que expiró la restricción.

El episodio capturó la brecha entre una salida impresionante y una herramienta confiable. La generación de video implica una factura de cómputo más alta que la generación de texto o imagen, y un flujo de trabajo se vuelve difícil de construir cuando un intento fallido puede agotar la capacidad disponible del usuario. Google había abierto Gemini Omni Flash a desarrolladores en vista previa para el 30 de junio, pero los límites de la API publicados siguen siendo modestos: salida de tres a diez segundos a 720p y 24 cuadros por segundo. El modelo de vista previa usa el ID gemini-omni-flash-preview. (Google AI for Developers)

La propia ficha de modelo de Gemini Omni Flash de Google pone límites alrededor de las demostraciones pulidas. Indica que la consistencia completa entre ediciones, el movimiento complejo y el renderizado preciso de texto siguen siendo un desafío. (Google DeepMind)

Esas advertencias no borran lo que produjo Shrivastava. Definen el trabajo que aún se requiere antes de que los avatares personales se conviertan en infraestructura de producción rutinaria. El uso inmediato más fuerte es la experimentación de formato corto, donde un creador puede tolerar otro intento y un clip breve aún puede transmitir el mensaje. Campañas más largas y repetibles demandan tiempos de generación predecibles, límites de capacidad más claros y continuidad a través de múltiples escenas.

Los creadores son parte de la maquinaria de lanzamiento de Google

Shrivastava describe su trabajo como probar productos tempranos, dar retroalimentación y traducir nuevas capacidades en historias para una audiencia. Gemini Omni Flash muestra por qué ese rol importa. El anuncio de Google explicó entradas multimodales y edición conversacional. Shrivastava redujo el argumento a una persona que teclea una instrucción y observa una versión de sí misma ejecutarla. (Ashutosh Shrivastava)

La relación también funciona en ambos sentidos. Un creador puede producir la demostración que hace comprensible a un modelo, y luego publicar la generación fallida y el problema de límite de uso que un video de lanzamiento oficial omitirá. Eso es más útil para los constructores que otra muestra perfecta. Muestra tanto el destino como el costo actual de alcanzarlo.

El ritmo rápido de lanzamientos de Google hace que esas pruebas externas sean cada vez más importantes. Gemini Omni Flash es una línea de producto distinta a las otras recientes versiones de modelos de la compañía, pero el patrón operativo es familiar: los modelos llegan rápido a los usuarios, y el comportamiento en producción se vuelve visible sólo cuando llegan cargas de trabajo reales.

El video de avatar de Shrivastava sigue siendo una demostración convincente porque el caso de uso es inmediato. También sigue siendo el resultado de un solo creador, producido en condiciones que no han sido evaluadas de forma independiente. La apuesta más grande de Google es que un modelo multimodal general pueda absorber tareas que hoy atienden productos separados de avatar, generación de video y edición. El clip muestra que esa consolidación está comenzando. El agotamiento del cupo de uso muestra por qué las herramientas especializadas aún tienen espacio.

Reader comments

Conversation for this story loads after sign-in.