Google lanza Lyria 3.5 en Flow Music con controles de BPM y voces más potentes

El lanzamiento convierte a la startup musical adquirida por Seth Forsgren y Hayk Martiros en la plataforma principal para el modelo más reciente de DeepMind.

By · Published

Primary source: Google Flow Music on X

Why it matters

Google is using an acquired founder-built product as the distribution layer for DeepMind's music models. The competitive contest is shifting toward editing control, distribution and licensing alongside audio quality.

Google ships Lyria 3.5 to Flow Music with BPM controls and stronger vocals

Google envió Lyria 3.5 a Flow Music el 29 de julio, poniendo el modelo musical más nuevo de DeepMind dentro del estudio de música con IA construido por Seth Forsgren y Hayk Martiros antes de que Google adquiriera su startup a principios de este año.

https://x.com/googleflowmusic/status/2082496617664413721?s=46

poster=/api/storage/public-objects/tweet-videos/google-lyria-3-5-flow-music-bpm-controls-poster-aa2f9e33.jpg|Video de @googleflowmusic en X

En un hilo en X, Google dijo que Lyria 3.5 produce cantos más expresivos, arreglos más ricos y pistas que siguen las instrucciones creativas con mayor fidelidad. La versión también agrega control directo de BPM, dando a los músicos una forma de especificar el tempo en lugar de generar canciones repetidamente hasta que el modelo se acerque al ritmo deseado.

La página del producto Lyria identifica la 3.5 como el modelo más reciente de la familia y dice que admite duraciones de canción variables de hasta tres minutos. Las demostraciones de Google abarcan varios idiomas y géneros, con indicaciones que especifican tempo, tonalidad, colocación vocal, instrumentación y estilo de producción.

La ficha del modelo de DeepMind cubre Lyria 3 y versiones subsecuentes. Describe un sistema de texto a audio que aplica difusión latente a representaciones temporales de audio, con indicaciones de texto como entradas y música y letras como salidas. La ficha del modelo indica que Google evalúa la familia por fidelidad de audio, calidad musical, voces y adherencia a las indicaciones.

De un proyecto hobby al producto musical de Google

Forsgren y Martiros se conocieron como estudiantes de pregrado en Princeton y tocaron juntos en una banda amateur por cerca de una década. En diciembre de 2022, lanzaron Riffusion, un proyecto hobby que usaba una versión de Stable Diffusion para generar imágenes de espectrogramas y convertirlas en clips de audio cortos.

El proyecto atrajo suficiente uso como para convertirse en una startup. Riffusion recaudó $4 millones en octubre de 2023 de Greycroft, South Park Commons y Sky9 Capital, y luego evolucionó a ProducerAI, un sistema conversacional para generar y revisar canciones completas.

Google adquirió ProducerAI el 24 de febrero y trasladó a su personal a Google Labs y Google DeepMind. Forsgren ahora se desempeña como gerente de producto de grupo para Google Flow Music. Martiros, que pasó casi una década trabajando en drones autónomos en Skydio antes de construir Riffusion, aparece listado entre los colaboradores de la familia de modelos Lyria.

Google describió inicialmente a ProducerAI como un producto potenciado por Lyria 3, Gemini, Veo y su modelo de imágenes Nano Banana. Más tarde renombró el servicio como Flow Music, conectando la interfaz de edición conversacional de los fundadores directamente con el portafolio de modelos de Google.

El control es el producto

La configuración de BPM de Lyria 3.5 encaja con la estrategia que Forsgren y Martiros han seguido desde Riffusion: convertir la generación en un proceso de producción iterativo. Flow Music ya permite a los usuarios revisar la estructura de una canción, alterar una mezcla, reemplazar secciones seleccionadas, crear covers y extender pistas mediante instrucciones en lenguaje natural. La documentación del producto de Google ofrece ejemplos como acortar una introducción, añadir un puente, cambiar instrumentos o hacer que un bombo sea más prominente.

Ese flujo de trabajo le da a Google una vía más allá de las indicaciones de texto de una sola ejecución. Un músico puede generar un borrador, seleccionar una sección y pedirle al agente Producer que la reemplace mientras preserva el resto de la pista. Flow Music también admite audio e imágenes subidas, stems descargables, videos musicales y Spaces creados por los usuarios que funcionan como instrumentos, efectos o secuenciadores.

Google ya está cobrando directamente por el producto. Los precios actuales de Flow Music incluyen un nivel gratuito y planes pagos que van de $6 a $48 por mes. Los planes de pago aumentan los créditos de generación y la concurrencia, mientras que el nivel más alto incluye acceso anticipado a nuevas funciones.

La distribución también avanza mediante alianzas con la industria. El 6 de mayo, Google anunció un acuerdo con Believe y TuneCore para dar acceso a Flow Music a artistas, productores y compositores seleccionados. Las empresas también crearon un programa semanal de retroalimentación destinado a incorporar a músicos en activo en el desarrollo del producto.

La pelea por derechos de autor sigue a cada lanzamiento de un modelo

Lyria 3.5 llega mientras el trabajo de Google en generación musical enfrenta una demanda colectiva propuesta por derechos de autor. Una demanda presentada el 6 de marzo alega que Google usó 44 millones de clips que representan 280,000 horas de la música de los demandantes para entrenar a Lyria sin permiso, según Bloomberg Law. Esas cifras son alegatos de los demandantes y no han sido establecidas por un tribunal.

Google ha dicho que sus modelos musicales usan material que Google y YouTube tienen derecho a usar en virtud de sus términos de servicio, acuerdos con socios y la ley aplicable. La compañía también incrusta en las pistas generadas SynthID, su marca de agua para identificar contenido generado o editado por IA.

La actualización del modelo avanza el producto que Forsgren y Martiros comenzaron como un experimento de código abierto hace menos de cuatro años. Bajo Google, ese proyecto se ha convertido en una suite de creación de pago, un canal de distribución para los modelos de DeepMind y una prueba de si la edición conversacional puede hacer que la música generada sea útil más allá de la primera indicación.

Reader comments

Conversation for this story loads after sign-in.