Meta dice que Muse Spark 1.2 gana 12.2 puntos cuando se le dan herramientas

MSL de Alexandr Wang informa que su modelo queda rezagado respecto a su predecesor sin herramientas y lo supera cuando se combina con el runtime de Meta.

By · Published

Primary source: AI at Meta

Why it matters

Meta's chart shows Muse Spark 1.2 trailing version 1.1 without tools and moving ahead once tools are enabled. For teams buying or building agents, that shifts scrutiny toward the whole model-runtime configuration, including its containment controls, rather than the model checkpoint alone.

Meta says Muse Spark 1.2 gains 12.2 points when given tools

Alexandr Wang's Meta Superintelligence Labs, la organización interna de IA de Meta, informó el 20 de agosto que Muse Spark 1.2 obtuvo 72.0 en 10 evaluaciones multimodales cuando pudo usar herramientas, frente a 59.8 sin ellas. La comparación recién publicada pone un número al esfuerzo de MSL por entrenar el modelo junto con el entorno de ejecución en el que trabaja. (research.meta.ai)

AI at Meta on X

Ese enfoque encaja con la trayectoria de Wang. Cofundó Scale AI a los 19 años con la tesis de que mejores datos e infraestructura de evaluación determinarían la rapidez con la que mejoran los sistemas de IA. Meta lo reclutó en 2025 después de realizar una inversión de $14.3 mil millones en Scale, adquiriendo aproximadamente el 49% en una transacción que valoró Scale en cerca de $29 mil millones. Wang ahora se desempeña como chief AI officer de Meta y dirige MSL, la organización que reconstruyó la pila de modelos de Meta y publicó el primer Muse Spark en abril. (about.fb.com)

Muse Spark 1.2 llegó el 5 de agosto como el modelo detrás de Muse Code, el agente de codificación por terminal de Meta. La entrada técnica del 20 de agosto informa cómo se desempeña el modelo cuando puede inspeccionar material visual e incorporar esas observaciones en razonamientos posteriores o llamadas a herramientas. Esa evaluación es el elemento nuevo aquí; Meta ya había presentado el modelo subyacente y el agente de codificación a principios de mes.

The improvement appears when the tools arrive

La comparación de Meta contiene un detalle inusualmente revelador. Muse Spark 1.2 obtuvo 59.8 sin herramientas, ligeramente por debajo del 60.2 de Muse Spark 1.1. Con herramientas habilitadas, 1.2 subió a 72.0, mientras que 1.1 alcanzó 69.1.

Eso da a la versión 1.2 un aumento de 12.2 puntos con herramientas, en comparación con un aumento de 8.9 puntos para su predecesor. El modelo más reciente supera a 1.1 por 2.9 puntos con herramientas y le queda 0.4 puntos detrás sin ellas. Las cifras de Meta sitúan la mejora reportada en la interacción entre el modelo y su entorno de trabajo. (research.meta.ai)

El agregado cubre SimpleVQA, WorldVQA, CharXiv Reasoning, ChartMuseum, ERQA, ChartQA-Pro, OmniSpatial, ZeroBench, BabyVision y PerceptionBench. El gráfico público de Meta proporciona las puntuaciones promedio, pero no resultados por benchmark. Tampoco establece que un evaluador externo pueda reproducir la ganancia. El aumento de 12.2 puntos no había sido replicado de forma independiente al 20 de agosto, según Artificial Analysis.

Meta ha publicado una metodología de evaluación multimodal junto con los resultados. La cifra principal sigue siendo un compuesto ejecutado por Meta, así que la comparación útil es la estrecha: dos generaciones del modelo de Meta medidas bajo el marco de Meta, con y sin acceso a herramientas.

Wang's lab is co-training the model and its workplace

Muse Spark 1.2 fue coentrenado con Muse Code, dando al modelo experiencia con el arnés que encuentra durante su uso. Meta dice que el entrenamiento incorporó trayectorias muestreadas del arnés, objetivos, compactación de contexto, subagentes y el conjunto de herramientas de Muse Code.

Muse Code mantiene agentes de fondo especializados activos durante toda la sesión en lugar de crear uno nuevo para cada tarea. También anexa llamadas al modelo, ejecuciones de herramientas, aprobaciones y ediciones a un registro de eventos local, permitiendo que el trabajo interrumpido se reanude desde el estado registrado. Esas elecciones de tiempo de ejecución apuntan a una debilidad persistente en los agentes de codificación: un modelo capaz aún puede recopilar el mismo contexto dos veces, perder una decisión anterior o fallar durante una tarea larga porque el software circundante no puede recuperarse limpiamente.

La puntuación por uso de herramientas le da a Meta un resultado medible para ese emparejamiento modelo-entorno de ejecución. No muestra cuánto de la ganancia proviene del modelo, de las herramientas disponibles, de la capa de orquestación o de su configuración combinada. Meta no ha divulgado puntuaciones por benchmark que muestren qué habilidades de razonamiento visual explican el aumento.

Tool use raises the containment stakes

La evaluación llegó seis días después de que Meta divulgara que un entorno de prueba de terceros configurado incorrectamente permitió que una versión previa a la publicación de Muse Spark 1.1 llegara a internet abierto. Al modelo se le dio el nombre de un sitio web real en lugar de un objetivo ficticio, encontró una vulnerabilidad, accedió a información y cambió la base de datos del sitio.

Meta dijo que el incidente fue aislado, que involucró al modelo 1.1 anterior y que se debió a la configuración del evaluador en lugar de una fuga de la sandbox. El episodio proporciona un ejemplo concreto del riesgo operativo detrás de las ganancias por uso de herramientas. Flujos de trabajo autónomos más largos y una mejor selección de herramientas exigen un control más estricto sobre los permisos, objetivos y acceso a la red de un agente. (research.meta.ai)

Meta dice que Muse Spark 1.2 está disponible a través de Muse Code y la Meta Model API. La entrada multimodal también describe los resultados como previos a un lanzamiento de pesos abiertos, sin fijar fecha ni licencia. Meta lanzó por separado Muse Glimmer, un modelo de 30 mil millones de parámetros destinado a ejecutarse localmente, el 10 de agosto.

Para Wang, la evaluación 1.2 convierte una tesis de infraestructura familiar en una estrategia de modelo. La puntuación de respuesta directa cambió apenas entre generaciones. Meta reportó una ganancia mayor después de conectar Muse Spark 1.2 con las herramientas y el entorno de ejecución para los que fue entrenado.

Reader comments

Conversation for this story loads after sign-in.