MiniMax lanza Music 3 para canciones de cinco minutos con generación jerárquica
El modelo de Yan Junjie separa la composición de largo alcance del renderizado acústico y acepta controles detallados por sección, aunque sus pesos oficiales no estuvieron disponibles al momento de la verificación.
By RuntimeWire Staff · Published
Primary source: MiniMax
Why it matters
Music 3 gives developers a detailed view of a five-minute song model that separates long-range composition from acoustic rendering. Its repository and demo expose the architecture, input controls and selected outputs, while the official weights were not yet available at verification.

MiniMax, la compañía de IA con sede en Shanghái fundada por Yan Junjie, anunció Music 3 el 13 de agosto de 2026, describiéndolo como un modelo de pesos abiertos para canciones completas de hasta cinco minutos a partir de letras y un brief de producción detallado. Un demo público y materiales técnicos estuvieron disponibles en el lanzamiento. El repositorio oficial contenía documentación y recursos, mientras que los materiales oficiales de la versión aún no pusieron a disposición los pesos del modelo. MiniMax también publicó un listado en ModelScope.
El anuncio dirigió a los desarrolladores a una página de modelo de Hugging Face, un repositorio de GitHub, ModelScope y un demo público. MiniMax califica a Music 3 como "listo para producción", una caracterización respaldada por ahora por muestras seleccionadas por la compañía y un ejemplo de generación reproducible en lugar de pruebas de calidad independientes, clientes divulgados o adopción por estudios profesionales.
El lanzamiento sigue la trayectoria técnica que Yan siguió tras más de seis años en SenseTime, donde ascendió a vicepresidente y subdirector de su instituto de investigación. La biografía del equipo directivo de MiniMax indica que Yan obtuvo un doctorado en inteligencia artificial en el Institute of Automation, Chinese Academy of Sciences, y posteriormente realizó investigación posdoctoral en Tsinghua University. El informe anual de MiniMax lo identifica como chairman, CEO y CTO, situando la investigación de modelos y la estrategia corporativa bajo el fundador.
Un modelo de canción construido alrededor de la jerarquía
Según la página oficial del modelo, Music 3 separa la composición del renderizado acústico. Un Global LLM de 8 mil millones de parámetros, inicializado desde Qwen3-8B, maneja la estructura de largo alcance y predice el primer codebook semántico de música. Un Local LLM de 0.6 mil millones de parámetros completa el detalle acústico a nivel de frame a través de siete codebooks adicionales.
Los estados ocultos de esos modelos alimentan un módulo Flow Matching de 2.4 mil millones de parámetros y un decodificador Flow-VAE de 123 millones de parámetros. Music 3 produce archivos WAV estéreo de 32 kHz y 16 bits. MiniMax dice que la arquitectura ayuda a mantener el ritmo, la identidad vocal, los temas musicales y los cambios de arreglo a lo largo de una canción completa.
Los usuarios proporcionan dos entradas: letras y una descripción musical. Las letras pueden llevar etiquetas de sección que incluyen [Intro], [Verse], [Pre-Chorus], [Chorus], [Bridge], [Instrumental], [Solo] y [Outro]. La descripción puede especificar género, BPM, tonalidad, progresión emocional, timbre vocal, coros de fondo, instrumentos, percusión y cambios en el arreglo.
Esa interfaz permite que un desarrollador solicite un primer verso comedido, introduzca batería en el coro y reserve un solo de guitarra para el puente. Los controles le dan a Music 3 un vocabulario de producción de canciones que va más allá de un único prompt de texto y permite a los usuarios describir cambios a lo largo de un arreglo de cinco minutos.
El tokenizador descrito en los materiales del modelo usa ocho codebooks de cuantización vectorial residual. Un codebook de 16,384 entradas representa contenido semántico, mientras que siete codebooks de 1,024 entradas transportan detalle acústico. Las instrucciones de inferencia describen generación a 25 frames de audio por segundo.
Lo que los desarrolladores pueden probar
MiniMax describió Music 3 como un lanzamiento de pesos abiertos, pero la distribución fue incompleta cuando se verificó el 13 de agosto. El repositorio oficial contenía documentación y recursos para el demo, mientras que los pesos oficiales aún no estaban disponibles.
El demo establece el formato de entrada y ofrece salidas seleccionadas.
Los materiales disponibles del modelo también describen la configuración de inferencia prevista. La tarjeta del modelo dice que la descarga a CPU puede reducir el uso de memoria de video a aproximadamente 8 GB. Las instrucciones del repositorio requieren CUDA, describen generación no en streaming y solicitan dos GPUs.
La compañía detrás de Music 3
MiniMax se fundó a principios de 2022 y desarrolla modelos y productos que abarcan texto, audio, imágenes, video y música. MiniMax afirma que sus modelos y productos han servido a más de 300 millones de personas en más de 200 países y regiones, junto con más de 1 millón de empresas y desarrolladores en más de 100 países y regiones. Esas son cifras a nivel de compañía; MiniMax no ha desglosado la adopción de Music 3.
Alibaba lideró una ronda de financiamiento de $600 millones en marzo de 2024 con una valoración superior a $2.5 mil millones, con la participación también de HongShan, según Fortune. MiniMax cotizó posteriormente en Hong Kong en enero de 2026 y recaudó aproximadamente $619 millones en su IPO, según Reuters.
El informe anual de MiniMax de 2025 registró $79 millones en ingresos, frente a $30.5 millones en 2024, junto con $252.8 millones en gastos de investigación y desarrollo. El informe anual de MiniMax listó 418 empleados al final de 2025, incluyendo 415 a tiempo completo y tres a tiempo parcial. Esas cifras cubren MiniMax Group y no específicamente al equipo de Music 3.
La salida de cinco minutos de Music 3 lo sitúa en el rango de otra familia de modelos de música descargables. Stable Audio 3.0 de Stability AI es una comparación de pesos abiertos que soporta composiciones de aproximadamente seis minutos, según los materiales de la compañía.
Competidores alojados como Suno y Udio evitan que los usuarios tengan que gestionar infraestructura de inferencia local. Los materiales del modelo de Music 3 describen una configuración de inferencia local prevista, aunque sus pesos oficiales no estaban disponibles cuando se verificaron.
MiniMax está defendiendo una demanda por derechos de autor en Estados Unidos presentada por Disney, Universal y Warner Bros. Discovery por supuesta formación no autorizada y salidas de Hailuo AI, el servicio de imagen y video de MiniMax. El caso no trata específicamente sobre Music 3.
Yan está usando Music 3 para poner la investigación de audio de MiniMax frente a desarrolladores que quieren canciones más largas y controles detallados de arreglo. Su arquitectura jerárquica y los demos de cinco minutos les dan una base inicial para la evaluación. Los pesos oficiales aún no estaban disponibles cuando se verificaron los materiales de la versión.