Tomas Koutsky explica cómo Meta hace que Muse Glimmer quepa en 24 GB
Meta dice que su agente local de 30B cabe en 24 GB o 32 GB junto con un contexto de 131K, un codificador de visión y un redactor especulativo. El cofundador de Byteline, Tomas Koutsky, explica la aritmética de la memoria.
By RuntimeWire Staff · Published
Primary source: Abstract Extraordinary
Why it matters
Muse Glimmer shows how a 30B local agent can preserve a 131K-token context without allowing its attention cache to consume most device memory. Actual performance still depends on prompt-processing time and whether the serving engine implements the sliding-window cache efficiently.

Meta ha lanzado Muse Glimmer, un agente multimodal de 30 mil millones de parámetros diseñado para ejecutarse en hardware de consumo con 24 GB o 32 GB de memoria. Tomas Koutsky, cofundador de la startup de flujos de trabajo de IA Byteline, examinó cómo Meta hace espacio para el modelo, un contexto de 131,072 tokens, un codificador de visión y un modelo de decodificación especulativa en el mismo dispositivo.
Koutsky aborda la arquitectura como un constructor de sistemas de agentes. Cofundó Byteline en 2025 para permitir que los usuarios coordinen varios agentes de IA mediante conversaciones en lenguaje natural. Anteriormente encabezó ingeniería en BRAHMA AI y Metaphysic.ai tras desempeñar roles de ingeniería en Pipedrive y Streetbees. Su análisis de Muse Glimmer, publicado el 18 de agosto, describe el modelo como una jerarquía de memoria construida alrededor de una caché estrecha de clave-valor.
Meta comprime los pesos por debajo de 20 GB
Meta lanzó Muse Glimmer el 10 de agosto bajo la licencia Apache 2.0. Meta lo describe como un modelo denso y multimodal para codificación local, llamadas a funciones, uso de herramientas y flujos de trabajo de agentes extendidos sin conexión a la nube. RuntimeWire cubrió la publicación de pesos abiertos, incluida la afirmación de Meta de que sus configuraciones cuantizadas pueden ejecutarse dentro de límites de memoria de 24 GB o 32 GB.
El checkpoint sin comprimir consumiría más de 55 GB. Meta dice que una cuantización de aproximadamente cuatro bits reduce el modelo de lenguaje a menos de 20 GB, dejando capacidad para la caché de clave-valor, el codificador de percepción y el redactor especulativo DFlash.
Koutsky calcula que Muse Glimmer contiene aproximadamente 29.777 mil millones de parámetros. Los 52 bloques Transformer de texto representan aproximadamente 25.165 mil millones de parámetros, mientras que la torre de visión contiene cerca de 1.853 mil millones. Estima un almacenamiento total en BF16 de 55.46 GiB, incluyendo los embeddings, la cabeza de salida no vinculada y el puente entre los componentes visuales y de lenguaje.
Meta probó su configuración K-Quant-17GB con el redactor DFlash cuantizado en MacBooks M4 Max y M5 Max y en una Nvidia RTX 5090. El redactor propone bloques de tokens que el modelo principal verifica en paralelo. Meta reporta aceleraciones de decodificación de 3.1 veces en la RTX 5090, 1.8 veces en la M5 Max y 1.5 veces en la M4 Max.
Una caché estrecha deja espacio para un contexto largo
Muse Glimmer limita la memoria que crece con cada token. A lo largo de sus 52 capas de texto, 39 atienden a una ventana deslizante de 2,048 tokens y 13 pueden inspeccionar la secuencia completa. El modelo también usa 32 cabezas de consulta con dos cabezas clave-valor. Las consultas para el token actual pueden descartarse, mientras que las claves y valores de tokens anteriores permanecen disponibles durante la generación. Almacenar dos bancos clave-valor en lugar de 32 reduce el estado acumulado por cada secuencia activa.
Koutsky estima una caché activa de clave-valor en BF16 o FP16 de aproximadamente 1.70 GiB con el contexto completo de 131,072 tokens. Las 13 capas globales representan alrededor de 1.625 GiB, con aproximadamente 78 MiB asignados a las capas locales después de que se llenan sus ventanas.
Esa estimación depende de la implementación de serving. Koutsky dice que un motor debe expulsar o reutilizar circularmente entradas obsoletas de las capas de ventana deslizante para materializar los ahorros. La asignación estática a lo largo de la secuencia completa consumiría sustancialmente más memoria. La cuantización de la caché, los tamaños de página, la fragmentación y los espacios de trabajo en tiempo de ejecución también pueden alterar el uso medido.
Treinta y nueve capas usan una ventana deslizante de 2,048 tokens, mientras que cada cuarta capa atiende todo el contexto.
El contexto largo aún tiene un costo computacional
Las 13 capas de atención global de Muse Glimmer realizan atención completa durante el procesamiento del prompt. Su trabajo de atención crece cuadráticamente con la longitud de la secuencia, incluso cuando núcleos eficientes en memoria evitan almacenar la matriz de atención completa. El análisis de Koutsky separa por tanto la capacidad de memoria del tiempo de procesamiento: la arquitectura puede hacer que quepa un contexto de 131K tokens sin que su prellenado sea equivalente a un prompt corto.
Las capas locales y globales dividen el trabajo de recuperación. Las capas locales preservan información ordenada dentro de ventanas acotadas. Las capas globales periódicas buscan representaciones que ya contienen contexto cercano. Koutsky señala que las capas globales omiten los embeddings posicionales rotatorios (RoPE) y emparejan material distante principalmente por contenido.
El orden aún llega a esas capas mediante la máscara causal y mediante representaciones producidas por tres capas locales previas equipadas con RoPE. Koutsky sostiene que la disposición puede soportar recuperación basada en contenido a través de largas distancias. Pasajes similares pueden ser más difíciles de distinguir cuando su contexto local no aporta suficiente separación.
Meta informa pérdida limitada por cuantización
Meta dice que su cuantización produce "degradación mínima o nula en tareas de agentes." Su publicación presenta los resultados de precisión en un gráfico que compara full precision, K-Quant-Dynamic y K-Quant-17GB, sin declarar una única cifra agregada de degradación en el texto acompañante.
Meta compara Muse Glimmer con Gemma 4 31B y Qwen3.6 27B. Su informe de metodología de evaluación describe el marco detrás de esas comparaciones. Los resultados reportados establecen la comparación elegida por Meta, mientras que el rendimiento en otros andamiajes de agentes y flujos de trabajo personales extendidos queda fuera del alcance de esos resultados.
El desglose de Koutsky explica la aritmética de memoria detrás de las afirmaciones de hardware de Meta. La cuantización reduce el costo fijo de los pesos, la grouped-query attention estrecha la caché persistente y el calendario de capas local-global limita cuánto historial retiene la mayoría de las capas. El procesamiento del prompt y la implementación de serving siguen determinando cómo se comporta el modelo cerca de su contexto máximo.