Microsoft 开源 Orchard 以降低 AI 代理训练成本
这个基于 Kubernetes 的框架在编码、浏览器和助理代理之间重用沙箱、数据集和训练流水线。
By Ryan Merket · Published
Primary source: Microsoft Research on X
Why it matters
Orchard makes a costly layer of agent training available as open-source infrastructure, giving startups and labs a self-hosted alternative to managed sandbox vendors.

Microsoft Research 在 8 月 3 日在 X 上的帖子中表示,它已经发布了 Orchard,这是一个基于 MIT 许可的框架,用于在编码、浏览器导航和个人助理任务上训练和评估 AI agents。该项目针对代理开发背后的一项昂贵问题:研究人员在每个模型和用例上反复构建沙箱基础设施、数据管道和评估系统。
https://x.com/msftresearch/status/2084309571351253460?s=46
Orchard 来自一个由 Baolin Peng 领导的小组,Peng 是一位主要研究经理,工作重点是由 LLM 驱动的 agents。Peng 在 Chinese University of Hong Kong 获得了计算机科学博士学位。Microsoft Research 的启动帖中列出的其他主要作者有 Wenlin Yao、Qianhui Wu、Hao Cheng 和 Jianfeng Gao,并有来自 Columbia University 和 University of Illinois Urbana-Champaign 的额外合作者。
该发布将 agent 基础设施转变为可重用的服务,而不是将其嵌入到特定的训练堆栈中。Orchard 的核心组件 Orchard Env 在 Kubernetes 上运行,并通过 REST 和 Python 接口暴露沙箱创建、命令执行、文件访问和网络控制。研究人员可以连接不同的 agent harness、训练器和推理系统,而无需为每次实验重建环境层。
这一设计解决了代理开发中日益昂贵的部分。软件工程的发布可能需要克隆仓库、安装依赖、编辑文件并在隔离容器内运行测试。强化学习实验可以在成千上万个并发环境中重复该过程。托管服务简化了供应,但会将研究人员绑定到外部控制平面及其定价。
A self-hosted alternative to managed sandboxes
Orchard paper 将该环境服务与包括 E2B、Daytona 和 Modal 在内的托管平台,以及诸如 MegaFlow 的集成研究系统进行了比较。Microsoft 的差异化点在于控制权:Orchard Env 可以在标准的 Kubernetes 集群上自托管,并可独立于上层运行的 agent harness 或训练框架使用。
Microsoft 给出的成本数字是估算值,而非客户账单。研究人员使用 2026 年 4 月收集的价格对一个工作负载进行建模:128 个沙箱,每个沙箱配备两个虚拟 CPU 和 8 GiB 内存,运行 240 小时。Orchard Env 在按需实例上的估计成本为 $3,362,使用 spot 容量时为 $673。同一论文在所建模的工作负载下估算 E2B 或 Daytona 的成本为 $7,078,Modal 为 $10,305。
这些节省假设团队能够操作 Kubernetes、配置网络策略并管理 spot 容量。Orchard 将开支从托管沙箱提供商转移出去,但并未消除运维工作。对于已经运行集群的研究实验室和 agent 初创公司来说,这种权衡可能很有吸引力,因为相同的基础设施可以处理数据生成、强化学习部署和最终评估。
GitHub repository 包含在 MIT 许可下的 Orchard Env 代码。其接口涵盖沙箱生命周期管理、命令执行、文件 I/O、补丁应用和网络隔离。Microsoft Research 表示该服务在测试期间以 100% 的成功率并行启动了 1,000 个沙箱,完成该过程用时 26 秒。
Three recipes test the same infrastructure
Microsoft Research 发布了三个领域特定的 recipes,以展示共享层如何支持不同的 agents。Orchard-SWE 用于训练软件工程 agents,Orchard-GUI 针对浏览器导航,Orchard-Claw 涵盖涉及电子邮件和日历等工具的生产力工作。
对于 Orchard-SWE,研究人员在 2,788 个仓库中收集了 107,185 条多回合软件工程轨迹。发布的数据集 包含成功与失败的尝试,为研究人员提供用于奖励建模和失败分析的负样本。论文报告称,Orchard-SWE 在使用大约 30 亿活动参数的模型时,在 SWE-bench Verified 上达到了 69.7%,当使用一个单独的价值模型对多个候选解进行重排序时上升到 73%。
Orchard-GUI 使用了 400 条蒸馏演示和 2,200 个开放式训练任务。Microsoft Research 报告在 WebVoyager、Online-Mind2Web 和 DeepShop 上的平均成功率为 68.4%。Orchard-Claw 在 200 个合成生产力任务上训练,允许三次尝试时通过率为 59.6%,与 ZeroClaw harness 配合时升至 73.9%。
这些基准结果由 Orchard 的作者报告,涵盖不同的测试集、harness 和推理设置,因此这些百分比并不是对三种 agents 的单一排名。它们的共同结果支持 Microsoft 的核心主张:较小的开放权重模型在研究人员重用 rollout、在逼真的 harness 中训练并保留先前实验而不是丢弃它们时,可以显著改进。
Microsoft packages a project that began in May
8 月 3 日的发布捆绑了已经开始公开出现的工作。第一篇 Orchard 论文于 5 月 14 日提交,而当前的第三版修订于 7 月 30 日发布。仓库显示 Orchard Env 和轨迹数据集在 5 月到达,随后 OpenWebRL 工作在 6 月出现,OpenForge RL 在 7 月出现。
这个时间线很重要,因为 Microsoft Research 正在发布一个不断增长的基础设施层,而不是单一的基准模型。软件、数据集和 recipes 为外部团队在自己的集群上运行 agent 训练提供了起点。对于销售托管 agent 沙箱的厂商,Orchard 还创建了一个开源的参考实现,可用于测试定价、延迟和可移植性声称。