Meta publica en código abierto el modelo de agente Muse Glimmer bajo la licencia Apache 2.0
Meta está publicando pesos descargables de Muse Glimmer bajo Apache 2.0, dando a los desarrolladores control sobre un modelo de agente multimodal que puede ejecutarse con límites de memoria de 24 GB o 32 GB.
By Ryan Merket · Published
Primary source: AI at Meta
Why it matters
Muse Glimmer gives engineering teams an Apache 2.0 agent model they can run and modify locally. Meta documents full-precision memory use above 55 GB, quantized weights below 20 GB, 24 GB and 32 GB deployment options, and RTX 5090 throughput reaching 233.4 tokens per second with speculative decoding.

Meta lanzó Muse Glimmer el 10 de agosto como un modelo descargable con licencia Apache 2.0 para trabajo de agentes multimodales y de codificación. Al publicar los pesos del modelo de aproximadamente 29.6 mil millones de parámetros, Meta les da a los desarrolladores una alternativa a su modelo alojado Muse Spark que pueden evaluar, modificar y ejecutar en su propia infraestructura.
Los pesos están disponibles a través de la ficha del modelo en Hugging Face, con recursos para desarrolladores separados que cubren el despliegue. Meta detalló el lanzamiento en un artículo técnico y anunció la descarga a través de AI at Meta.
Los pesos Apache 2.0 ponen a los desarrolladores en control
La licencia Apache 2.0 de Glimmer permite a los equipos inspeccionar y modificar el modelo descargable bajo los términos de la licencia. Ese modelo de distribución traslada la responsabilidad del despliegue, el rendimiento y la infraestructura a los operadores, pero también les permite evaluar el modelo en su propio hardware en lugar de acceder a él únicamente mediante un servicio alojado.
Glimmer es un proyecto interno de Meta más que una empresa financiada por separado. Los materiales de lanzamiento no identifican fundadores individuales ni creadores del modelo, y no revelan financiación específica para Glimmer, clientes, cifras de uso ni precios.
Meta dice que destiló Glimmer a partir de Muse Spark, transfiriendo el comportamiento del modelo maestro más grande a un paquete pensado para despliegue local. Muse Spark 1.1, lanzado el 9 de julio por Meta Superintelligence Labs, sigue siendo un modelo de razonamiento multimodal alojado disponible en Thinking mode a través de Meta AI y la vista previa pública de la Meta Model API.
Spark 1.1 admite codificación, llamadas a herramientas, uso del equipo y entendimiento multimodal. Meta dice que puede generalizar a nuevas herramientas nativas, servidores Model Context Protocol y habilidades personalizadas, luego planear el trabajo y delegar la ejecución entre subagentes en paralelo. Glimmer lleva el comportamiento de agente relacionado a un paquete con licencia Apache con infraestructura controlada por el operador y requisitos de memoria local fijos.
Las versiones cuantizadas apuntan a sistemas de 24 GB y 32 GB
La denominación Muse-Glimmer-30B indica su clase de modelo 30B. La ficha del modelo oficial reporta aproximadamente 29.6 mil millones de parámetros totales, incluyendo un codificador de percepción de 1.8 mil millones de parámetros. Glimmer utiliza una arquitectura Transformer causal densa con 52 capas, un estado oculto de 6,656 dimensiones, 32 cabezas de atención de consulta y dos cabezas de atención clave-valor.
El repositorio Muse-Glimmer-30B-GGUF relacionado empaqueta pesos cuantizados derivados del mismo modelo base de clase 30B. La inferencia en precisión completa requiere más de 55 GB de memoria, y la ficha del modelo identifica 64 GB de VRAM como el objetivo de despliegue.
Las versiones de aproximadamente 4 bits de Meta reducen los pesos del modelo de lenguaje a menos de 20 GB. Los sobrecitos de hardware documentados son 32 GB de VRAM para K-Quant-Dynamic y 24 GB para la variante K-Quant-17GB. Esas configuraciones reservan capacidad para la caché clave-valor, el procesamiento de imágenes, el codificador de percepción y un modelo separado de decodificación especulativa, según los materiales técnicos de Meta.
Glimmer se distribuye con un redactador DFlash que propone bloques de 16 tokens para que el modelo principal los verifique. En la prueba de Meta con la Nvidia RTX 5090, DFlash aumentó la velocidad de generación de K-Quant-17GB de 74.9 a 233.4 tokens por segundo, una mejora de 3.1x. La ficha del modelo también reporta un aumento de 23.7 a 37.8 tokens por segundo en un Apple M4 Max y de 26.6 a 50.2 en un M5 Max. Estas son mediciones de Meta y pueden variar según los prompts, la configuración de ejecución y la memoria disponible.
Hugging Face enumera vías de despliegue local a través de llama.cpp, vLLM, SGLang, Ollama, Unsloth Studio, OpenClaw y Hermes Agent. Al lanzamiento, Meta dijo que integraciones optimizadas con llama.cpp, MLX y ExecuTorch estaban planeadas para los días siguientes. Los equipos aún necesitarán probar la latencia, la fiabilidad de las llamadas a herramientas, el consumo de memoria y el rendimiento sostenido frente a sus propias cargas de trabajo.
El modelo abierto admite trabajo de agente multimodal
Glimmer acepta texto e imágenes y genera texto. Meta documenta una ventana de contexto de al menos 131,072 tokens y un corte de conocimiento al 4 de enero de 2026. Sus fuentes de entrenamiento divulgadas incluyen datos multimodales disponibles públicamente, datos de terceros, productos y servicios de Meta, y material curado o enriquecido por proveedores externos y personal de Meta, según la ficha del modelo.
Meta describe el modelo como capaz de planificación en múltiples pasos, llamadas a funciones basadas en esquemas y ejecución de tareas a largo plazo. Puede diagnosticar llamadas fallidas a herramientas y reintentar, escribir y depurar código, e interpretar capturas de pantalla, gráficos y documentos. La compañía también documenta una fuerza de razonamiento controlable, compatibilidad con OpenClaw y estructuras similares para agentes, y soporte para más de 100 idiomas en su artículo de lanzamiento.
La ficha del modelo Glimmer de Meta reporta puntuaciones de 75.5 en MCP Atlas, 74.6 en DeepSearch QA, 51.2 en SWE-Bench Pro, 76.0 en SWE-Bench Verified, 51.7 en TerminalBench 2.1 y 65.1 en Beam128K. Los resultados cubren uso de herramientas, ingeniería de software, operación de terminal y comportamiento con contexto largo. Son cifras reportadas por la compañía y no evaluaciones independientes.
Para los equipos de ingeniería, la compensación central es el control frente a la carga operativa. Los pesos con licencia Apache de Glimmer hacen que el modelo esté disponible para evaluación y modificación local, mientras que sus demandas de memoria, la pila de servicio y la fiabilidad de las llamadas a herramientas siguen siendo responsabilidad del operador.