Microsoft 发布 EvoLib,用于无需权重更新即可学习的 LLM 代理

该框架将模型轨迹转化为可复用的技能和洞见,研究代码以 MIT 许可证发布。

By · Published

Primary source: Microsoft Research on X

Why it matters

EvoLib gives agent builders a way to reuse lessons across tasks when model weights are inaccessible, but its value depends on reliable self-evaluation and production testing. ([github.com](https://github.com/microsoft/EvoLib))

Microsoft releases EvoLib for LLM agents that learn without weight updates

Microsoft Research 发布了 EvoLib 于 7 月 30 日,这是一种测试时学习(test-time learning)框架,旨在帮助大型语言模型在不更改其底层权重的情况下在多项任务上改进。该公告紧随一篇在 5 月 14 日首次发布的论文(并于 7 月 14 日修订)之后,Microsoft 还发布了一个技术说明EvoLib 代码。(microsoft.com)

https://x.com/msftresearch/status/2082860019016438152?s=46

poster=/api/storage/public-objects/tweet-videos/microsoft-evolib-llm-agents-learn-without-weight-updates-pos-6272bbfb.jpg|来自 @MSFTResearch 的 X 视频

论文的七位作者是 Weijia Xu、Alessandro Sordoni、Chandan Singh、Zelalem Gero、Michel Galley、Xingdi Yuan 和 Jianfeng Gao。第一作者 Weijia Xu 是 Microsoft Research Redmond 的高级研究员,曾在 University of Maryland, College Park 获得计算机科学博士学位。她的研究聚焦于能够在目标变化时进行规划、行动和交互的语言模型。Jianfeng Gao,Microsoft 的 technical fellow 和 corporate vice president,负责为包括 Bing、Azure AI、Microsoft 365 和 Copilot 在内的产品设定公司范围内的 AI 模型方向。(microsoft.com)

将代理历史转化为可重用的知识

EvoLib 解决了许多代理记忆系统的一个弱点:保留对话记录、推理轨迹或先前操作并不能保证模型能从中提取出有用的教训。大型档案随着相似、过时或适用范围狭窄的记录累积也会使检索变得更困难。

该框架将模型的推理轨迹处理为两种形式的知识。“模块化技能”(Modular skills)是可重用的过程,如编程函数或代理的子任务工作流。“反思性见解”(Reflective insights)是从失败尝试中提炼出的自然语言规则。该库在问题实例间共享,允许在一个任务中提取的知识影响后续任务。(microsoft.com)

EvoLib 会合并相似条目,而不是让库扩展为无结构的日志。它还使用信息增益(Information Gain)和未来信息增益(Future Information Gain)来分配权重。第一个分数衡量某个抽象是否有助于当前任务;第二个则会为后来产生其他有用知识的抽象赋予信用。被测量为更有价值的条目在后续提示中出现的概率更高。(github.com)

这一架构对通过 API 使用封闭模型的开发者很重要。EvoLib 不需要访问模型参数或梯度更新,因此 Microsoft 表示它可以在黑箱 LLM 周围运行。它的自监督评估可以使用可执行测试、投票多数或 LLM 判断者,而不是标注训练数据。发布的实现包含一个 Azure OpenAI 聊天包装器,尽管研究人员将该框架描述为通常兼容黑箱模型。(github.com)

Microsoft 报告在数学、代码和代理任务上均有提升

研究人员在 2025 和 2026 年的 93 道 Harvard-MIT Mathematics Tournament 问题、148 道 BigCodeBench Hard 任务、80 道 LiveCodeBench v6 Hard 问题、90 道 ScienceWorld 任务和 60 道 PDDL 规划任务上评估了 EvoLib。实验在 BigCodeBench 使用 GPT-4o,在其他基准组使用 o4-mini。(arxiv.org)

根据论文,EvoLib 在静态基准设置中相比基础采样(base sampling)提高了 11% 到 20%。在 HMMT 上,其报告的准确率达到 77.4%,而基础模型为 57%,Best-of-N 采样为 74.2%。其在 BigCodeBench 的通过率为 40.8%,而基础模型为 29.7%,Best-of-N 为 37.2%。EvoLib 在 LiveCodeBench 上以 70% 的通过率与 Recursive Self-Aggregation 并列。(arxiv.org)

Microsoft 还报告称,EvoLib 在三个基准上相比其比较中的最强测试时学习基线 Dynamic Cheatsheet 提高了 5% 到 10%。研究人员使用加权 token 计数来衡量成本,该计数将输出 token 的成本视为输入 token 的四倍,反映了典型的专有模型定价。在降低计算预算的情况下,EvoLib 在编码测试中比测试时扩展(test-time scaling)基线保留了更大的增益。(arxiv.org)

这些结果来自由 EvoLib 作者选择并运行的受控基准。它们并不能证明代理在长期生产部署中会安全地改进。EvoLib 依赖于模型自身评估产生有用信号。作者表示,当检查一个答案比生成一个答案更容易时(例如可以运行并通过测试的代码),它效果最好。开放式答案可能需要单独的验证器,论文并未证明在数学、编码和被评估的代理环境之外的性能。(arxiv.org)

GitHub 发布采用 MIT 许可证,并包含数学、代码、ScienceWorld 和 PDDL 任务的评估路径。Microsoft 将其标注为研究代码,并建议在没有进一步测试的情况下不要用于商业、真实世界或高风险的部署。该警告指出了核心的操作风险:模型可能错误评估自身工作,从而存储错误的教训、重复应用并随着时间推移复合错误。(github.com)

Reader comments

Conversation for this story loads after sign-in.