Meta afirma resultados de nivel oro en cinco Olimpiadas STEM

Meta reportó puntuaciones perfectas en teoría de la física, mientras dejaba sin especificar los modelos y la configuración de evaluación.

By · Published

Primary source: AI at Meta on X

Why it matters

Olympiad exams offer harder, fresher reasoning tests than saturated benchmarks, but Meta's scores cannot be compared cleanly until it identifies the models and test-time setup.

Meta claims gold-level AI results across five STEM Olympiads

Meta dijo en una publicación del 6 de agosto que sus modelos de IA lograron un rendimiento de nivel medalla de oro en cinco competencias de Olimpiadas STEM, incluyendo puntuaciones perfectas en los exámenes teóricos de la Asian Physics Olympiad y la International Physics Olympiad.

https://x.com/AIatMeta/status/2085388945148297322

poster=/api/storage/public-objects/tweet-videos/meta-ai-models-gold-stem-olympiads-reasoning-test-poster-68c88e89.jpg|Video de @AIatMeta en X

El anuncio presenta las competencias como una prueba de si los modelos de Meta están haciendo "progreso genuino en razonamiento". Ese es un umbral más exigente que otra puntuación de referencia. Los problemas de las olimpiadas se escriben para la competencia de cada año, requieren derivaciones largas y pueden incluir diagramas u otra información visual. Las respuestas se califican por el trabajo intermedio, en lugar de una selección final de opción múltiple.

El texto acompañante de Meta nombró los dos resultados de física pero no identificó qué modelos los produjeron. Tampoco indicó la configuración de inferencia, el número de intentos, el acceso a herramientas, el presupuesto de cómputo ni si Meta seleccionó respuestas de múltiples agentes o ejecuciones. Esos detalles determinan qué tan estrechamente el resultado mide la capacidad de razonamiento de un solo modelo en lugar del desempeño de un sistema mayor en tiempo de prueba.

Las puntuaciones perfectas en teoría cubren parte de los concursos de física

Meta especificó que sus resultados perfectos se aplicaron a los exámenes teóricos. Ambas olimpiadas de física también incluyen componentes experimentales, por lo que las puntuaciones de la compañía son más limitadas que un resultado humano completo en la competencia.

La Olimpiada Asiática de Física sigue la estructura de la International Physics Olympiad, con un examen teórico de cinco horas y trabajo de laboratorio separado. La competencia asiática 2026 se celebró en Busan, Corea del Sur, según la historia oficial del evento.

Meta dijo previamente que su envío a la Olimpiada Asiática de Física obtuvo 30 de 30 y empató con los tres primeros estudiantes. La publicación del 6 de agosto amplió la reseña de la compañía a la International Physics Olympiad, donde Meta afirmó que un modelo también obtuvo una puntuación perfecta en teoría.

Ese resultado en la IPhO coincidió con un estándar alcanzado por concursantes humanos este año. Dos miembros del equipo de Vietnam 2026 obtuvieron 30 de 30 en el examen teórico, según el Ministerio de Educación y Capacitación del país, informado por VnExpress. La comparación relevante es, por tanto, con las actuaciones humanas más fuertes en teoría, sin cubrir el examen de laboratorio que los competidores también completaron.

El modelo no nombrado es fundamental para la afirmación

Meta lanzó Muse Spark 1.1 el 9 de julio, describiéndolo como un modelo multimodal de razonamiento para codificación, uso de herramientas y tareas con agentes. El anuncio sobre las olimpiadas no indicó si Muse Spark 1.1, otro modelo público o un sistema interno de investigación generó las soluciones reportadas.

Esa distinción importa porque Meta ha desarrollado explícitamente sistemas de razonamiento que escalan la inferencia a través de varios agentes. Cuando Meta presentó el Muse Spark original en abril, describió un modo "Contemplating" que hace que múltiples agentes razonen en paralelo. Un resultado producido por tal orquestación puede ser evidencia útil sobre el sistema general, pero no es directamente comparable con un solo modelo respondiendo una vez bajo un presupuesto fijo de tokens.

La versión más sólida del caso de Meta emparejaría la hoja de resultados con los prompts exactos, el checkpoint del modelo, los límites de tiempo, los permisos de herramientas, las soluciones completas y los registros de calificación. El anuncio del 6 de agosto ofreció en su lugar los resultados principales.

Las pruebas de olimpiadas están sustituyendo a benchmarks saturados

Los laboratorios de IA se han volcado cada vez más a competencias académicas recientes porque los conjuntos de benchmarks citados comúnmente pueden saturarse o filtrarse en los datos de entrenamiento. Los problemas en vivo o recién publicados de las olimpiadas reducen ese riesgo de contaminación y prueban si un sistema puede sostener una cadena de razonamiento a través de problemas no familiares.

La dificultad sigue siendo sensible a la metodología. Un modelo puede generar varias soluciones candidatas, usar software externo, buscar en la web o apoyarse en un segundo modelo para criticar su trabajo. Los concursantes humanos operan bajo reglas fijas de tiempo, herramientas y envío. Las etiquetas de medalla sólo tienen sentido cuando la evaluación indica cuáles de esas restricciones se conservaron.

La investigación publicada con el benchmark HiPhO de física ilustra cuán rápido se ha movido el rendimiento. Su evaluación de 30 modelos de lenguaje y multimodales encontró que los sistemas de razonamiento cerrados podían alcanzar umbrales de medalla de oro en varios exámenes recientes de física, aunque la mayoría de los modelos no alcanzaron la puntuación máxima. Meta ahora afirma resultados perfectos en teoría en dos competencias en vivo de 2026 y un rendimiento de nivel oro en cinco olimpiadas.

Las puntuaciones colocan a Meta en la primera fila de los sistemas de razonamiento científico según la compañía. Establecer cuánto progreso corresponde a los modelos subyacentes requerirá conocer la configuración de prueba detrás de ellos.

Reader comments

Conversation for this story loads after sign-in.