Microsoft lanza EvoLib para agentes LLM que aprenden sin actualizaciones de pesos

El marco convierte las trayectorias del modelo en habilidades y conocimientos reutilizables, con el código de investigación publicado bajo una licencia MIT.

By · Published

Primary source: Microsoft Research on X

Why it matters

EvoLib gives agent builders a way to reuse lessons across tasks when model weights are inaccessible, but its value depends on reliable self-evaluation and production testing. ([github.com](https://github.com/microsoft/EvoLib))

Microsoft releases EvoLib for LLM agents that learn without weight updates

Microsoft Research lanzó EvoLib el 30 de julio, un marco de aprendizaje en tiempo de prueba diseñado para ayudar a los large language models a mejorar en distintas tareas sin cambiar sus pesos subyacentes. El anuncio sigue a un artículo publicado por primera vez el 14 de mayo y revisado el 14 de julio, con Microsoft publicando también una explicación técnica y el código de EvoLib. (microsoft.com)

https://x.com/msftresearch/status/2082860019016438152?s=46

poster=/api/storage/public-objects/tweet-videos/microsoft-evolib-llm-agents-learn-without-weight-updates-pos-6272bbfb.jpg|Video de @MSFTResearch en X

Los siete autores del artículo son Weijia Xu, Alessandro Sordoni, Chandan Singh, Zelalem Gero, Michel Galley, Xingdi Yuan y Jianfeng Gao. La autora principal Weijia Xu es investigadora sénior en Microsoft Research Redmond, quien obtuvo su doctorado en ciencias de la computación en la University of Maryland, College Park. Su trabajo se centra en modelos de lenguaje que pueden planear, actuar e interactuar bajo metas cambiantes. Jianfeng Gao, Microsoft technical fellow y vicepresidente corporativo, fija la dirección de la compañía para modelos de IA usados en productos como Bing, Azure AI, Microsoft 365 y Copilot. (microsoft.com)

Convertir los historiales de agentes en conocimiento reutilizable

EvoLib aborda una debilidad en muchos sistemas de memoria de agentes: conservar una transcripción, una traza de razonamiento o una acción previa no garantiza que un modelo pueda extraer una lección útil de ello. Los archivos grandes también pueden dificultar la recuperación a medida que se acumulan registros similares, desactualizados o de aplicabilidad limitada.

El marco procesa las trayectorias de inferencia de un modelo en dos formas de conocimiento. Las "modular skills" son procedimientos reutilizables, como funciones para programar o flujos de trabajo de subtareas para un agente. Las "reflective insights" son reglas en lenguaje natural destiladas de intentos fallidos. La biblioteca se comparte entre instancias de problemas, permitiendo que el conocimiento extraído durante una tarea influya en tareas posteriores. (microsoft.com)

EvoLib consolida entradas similares en lugar de permitir que la biblioteca se expanda como un registro no estructurado. También asigna pesos usando Information Gain y Future Information Gain. La primera puntuación mide si una abstracción ayuda en la tarea actual. La segunda otorga crédito a abstracciones que más tarde producen otro conocimiento útil. Las entradas con mayor valor medido tienen más probabilidades de aparecer en prompts subsecuentes. (github.com)

Esa arquitectura importa para desarrolladores que usan modelos cerrados a través de APIs. EvoLib no requiere acceso a parámetros del modelo ni a actualizaciones de gradiente, por lo que Microsoft afirma que puede operar con LLMs de caja negra. Su evaluación auto-supervisada puede usar pruebas ejecutables, votación mayoritaria o un juez LLM en lugar de datos etiquetados de entrenamiento. La implementación publicada incluye un wrapper de Azure OpenAI chat, aunque los investigadores describen el marco como compatible con modelos de caja negra en general. (github.com)

Microsoft reporta mejoras en matemáticas, código y tareas de agentes

Los investigadores evaluaron EvoLib en 93 problemas del Harvard-MIT Mathematics Tournament de 2025 y 2026, 148 tareas Hard de BigCodeBench, 80 problemas Hard de LiveCodeBench v6, 90 tareas de ScienceWorld y 60 tareas de planificación PDDL. Los experimentos usaron GPT-4o para BigCodeBench y o4-mini para los otros grupos de benchmark. (arxiv.org)

Según el artículo, EvoLib mejoró sobre el muestreo base entre 11% y 20% en los entornos de benchmark estáticos. En HMMT, su exactitud reportada alcanzó 77.4%, en comparación con 57% para el modelo base y 74.2% para Best-of-N sampling. Su tasa de aprobación en BigCodeBench fue 40.8%, frente a 29.7% para el modelo base y 37.2% para Best-of-N. EvoLib empató con Recursive Self-Aggregation en una tasa de aprobación del 70% en LiveCodeBench. (arxiv.org)

Microsoft también informa que EvoLib superó a Dynamic Cheatsheet, la línea base de aprendizaje en tiempo de prueba más fuerte en su comparación, por 5% a 10% en tres benchmarks. Los investigadores midieron el costo usando un conteo ponderado de tokens que trataba los tokens de salida como cuatro veces más caros que los tokens de entrada, reflejando la tarificación típica de modelos propietarios. Bajo presupuestos de cómputo reducidos, EvoLib mantuvo ganancias mayores que las líneas base de escalado en tiempo de prueba en las pruebas de codificación. (arxiv.org)

Esos resultados provienen de benchmarks controlados seleccionados y ejecutados por los autores de EvoLib. No establecen que un agente mejorará de forma segura durante un despliegue prolongado en producción. EvoLib depende de que la propia evaluación del modelo produzca una señal útil. Los autores dicen que funciona mejor cuando verificar una respuesta es más fácil que generarla, como con código que puede ejecutarse contra pruebas. Las respuestas abiertas pueden requerir un verificador separado, y el artículo no establece rendimiento fuera de matemáticas, programación y los entornos de agente evaluados. (arxiv.org)

El Lanzamiento en GitHub incluye una licencia MIT y rutas de evaluación para matemáticas, código, ScienceWorld y tareas PDDL. Microsoft lo etiqueta como código de investigación y desaconseja su despliegue comercial, en entornos reales o de alto riesgo sin pruebas adicionales. La advertencia identifica el riesgo operacional central: un modelo que juzgue mal su propio trabajo puede almacenar malas lecciones, reaplicarlas y agravar el error con el tiempo. (github.com)

Reader comments

Conversation for this story loads after sign-in.