AMD lanza Instella-MoE para mostrar el entrenamiento de extremo a extremo en las Instinct GPUs.
El modelo de 16 mil millones de parámetros activa 2,8 mil millones de parámetros por token y se distribuye con seis puntos de control, recetas de entrenamiento y código.
By Ryan Merket · Published
Primary source: X
Why it matters
Instella-MoE gives AI teams a reproducible test of AMD's stack for sparse-model training and RL, though its research-only weight license limits commercial use.

Los investigadores de AMD dirigidos por Jiang Liu y Prakamya Mishra (@PrakamyaMishra) publicaron Instella-MoE el 24 de julio, proporcionando a los desarrolladores los pesos y artefactos de entrenamiento para un modelo de lenguaje mixture-of-experts construido desde cero en GPUs AMD Instinct. Mishra describió el lanzamiento en un hilo en X el lunes como el primer modelo MoE totalmente abierto de AMD.
El lanzamiento pone a dos investigadores de AMD detrás del trabajo a la vista del público. Liu, líder del proyecto Instella-MoE, se unió a AMD después de completar un doctorado en ingeniería eléctrica y de computación en Johns Hopkins University en 2024. Mishra es un ingeniero de investigación aplicada en el grupo GenAI de AMD con sede en Seattle, donde trabaja en técnicas de entrenamiento a gran escala. Anteriormente investigó procesamiento de lenguaje natural en UMass Amherst y trabajó con los grupos de NLU y comprensión del lenguaje hablado de Amazon.

Instella-MoE contiene 16 mil millones de parámetros, mientras que su arquitectura dispersa activa 2.8 mil millones por cada token. Sus 27 capas de decodificador usan dos expertos compartidos y enrutan cada token a través de seis de los 64 expertos disponibles, una estructura destinada a preservar la capacidad del modelo sin incurrir en el costo computacional de activar cada parámetro para cada token.
AMD dice que entrenó el modelo con 7.1 billones de tokens usando los aceleradores Instinct MI300X y MI325X, ROCm y su framework de entrenamiento Primus. La mezcla de datos cubrió texto web general, código, matemáticas y ciencias. AMD luego ejecutó etapas separadas de entrenamiento intermedio, contexto largo, ajuste fino supervisado, optimización directa de preferencias y aprendizaje por refuerzo. El entrenamiento de contexto largo amplió la ventana soportada de 4,000 a 64,000 tokens.
El alcance del lanzamiento importa tanto como el punto de control final. AMD publicó una colección de seis modelos en Hugging Face que cubre preentrenamiento, entrenamiento intermedio, base de contexto largo, ajuste fino supervisado, optimización de preferencias y aprendizaje por refuerzo. El repositorio de Instella-MoE incluye configuraciones de entrenamiento, detalles de la mezcla de datos, herramientas de inferencia y código para reproducir la canalización.
Ese paquete convierte a Instella-MoE en una implementación de referencia para entrenar modelos dispersos modernos en hardware AMD. Los lanzamientos de modelos por parte de fabricantes de chips cumplen una finalidad comercial incluso cuando el modelo en sí está orientado a la investigación: ofrecen a posibles clientes código funcional, datos de rendimiento y una arquitectura que pueden inspeccionar mientras evalúan una alternativa al stack de software dominante de Nvidia.
AMD prueba todo el pipeline de entrenamiento
Instella-MoE también le da a AMD un vehículo para dos técnicas de sistemas desarrolladas alrededor de los costos de comunicación de los modelos mixture-of-experts. La primera, Gated Multi-head Latent Attention, añade una puerta aprendida que controla cuánto de cada salida de atención avanza. La segunda, FarSkip-Collective, superpone comunicación y cómputo entre GPUs durante el entrenamiento y el serving en paralelo por expertos.
AMD informa que FarSkip-Collective aumentó la velocidad de preentrenamiento en 12.7%. AMD también midió reducciones de hasta 39.2% en el tiempo hasta el primer token al servir el modelo con paralelismo de expertos. Esas cifras provienen de pruebas propias de AMD y dependen de la configuración de serving paralelo especificada.
Los benchmarks también son reportados por la compañía. AMD dice que el punto de control base promedió 76.7 en sus evaluaciones estándar seleccionadas, por delante de los modelos totalmente abiertos OLMo-3-7B y OLMoE-1B-7B incluidos en su comparación. El Think checkpoint final de AMD, refinado con aprendizaje por refuerzo, produjo un promedio de 73.22 en la tabla posterior al entrenamiento y una puntuación de 83.70 en IFEval. La comparación ubicó a Instella-MoE detrás de Qwen3.5-4B-Base en el promedio del modelo base, mientras que el Think checkpoint de AMD lideró los modelos totalmente abiertos seleccionados para su tabla posterior al entrenamiento.
La apertura del modelo también conlleva un límite de licencia. AMD publicó el código de entrenamiento bajo la licencia MIT, mientras que los puntos de control usan una licencia ResearchRAIL limitada a fines académicos y de investigación. Los desarrolladores pueden inspeccionar las recetas, las mezclas de datos y los pesos intermedios, pero la licencia del modelo no es una concesión de código abierto comercial irrestricta.
AMD también advierte que los puntos de control no ofrecen garantías de seguridad, no han sido probados para desempeño multilingüe y no son adecuados para aplicaciones críticas para la seguridad, médicas o que requieran alta precisión. Esas restricciones hacen de Instella-MoE un artefacto de investigación más que un modelo de producción pensado para un despliegue inmediato.
Para AMD, el resultado más trascendental es la evidencia de que ROCm y los aceleradores Instinct pueden llevar un proyecto MoE a través de preentrenamiento, ajuste de preferencias y aprendizaje por refuerzo. Instella-MoE proporciona a equipos externos los artefactos para probar esa afirmación sobre el código y los puntos de control en lugar de depender únicamente de benchmarks de hardware.