Microsoft、AIエージェントのトレーニングコスト削減のためにOrchardをオープンソース化
Kubernetesベースのフレームワークは、コーディング、ブラウザ、アシスタントの各エージェント間でサンドボックス、データセット、トレーニングパイプラインを再利用します。
By Ryan Merket · Published
Primary source: Microsoft Research on X
Why it matters
Orchard makes a costly layer of agent training available as open-source infrastructure, giving startups and labs a self-hosted alternative to managed sandbox vendors.

Microsoft Researchが8月3日のXへの投稿で、コーディング、ブラウザナビゲーション、パーソナルアシスタントのタスクにまたがるAIエージェントの訓練と評価のためのMITライセンスのフレームワークであるOrchardを公開したと発表した。本プロジェクトは、エージェント開発の背後にある高コストな問題――研究者が各モデルやユースケースごとにサンドボックスインフラ、データパイプライン、評価システムを繰り返し構築すること――を対象としている。
https://x.com/msftresearch/status/2084309571351253460?s=46
Orchardは、LLM駆動のエージェントに焦点を当てた研究を行うプリンシパルリサーチマネージャーのBaolin Pengが率いるグループによるものだ。PengはChinese University of Hong KongでコンピュータサイエンスのPh.D.を取得している。Microsoft Researchの発表記事で名の挙がっている他の主要著者はWenlin Yao、Qianhui Wu、Hao Cheng、Jianfeng Gaoで、コラボレーターにはColumbia UniversityやUniversity of Illinois Urbana-Champaignの研究者が含まれる。
今回のリリースは、エージェントのインフラを特定のトレーニングスタックに埋め込むのではなく、再利用可能なサービスに変換する。OrchardのコアコンポーネントであるOrchard EnvはKubernetes上で動作し、RESTおよびPythonインターフェースを通じてサンドボックスの作成、コマンド実行、ファイルアクセス、ネットワーク制御を公開する。研究者は、各実験ごとに環境レイヤーを再構築することなく、異なるエージェントハーネス、トレーナー、推論システムを接続できる。
その設計は、エージェント開発においてますますコストがかかる部分に対処する。ソフトウェアエンジニアリングの展開では、リポジトリのクローン、依存関係のインストール、ファイル編集、隔離コンテナ内でのテスト実行が必要になることがある。強化学習の実験では、そのプロセスを数千の同時環境にわたって繰り返すことがあり得る。マネージドサービスはプロビジョニングを簡素化するが、外部のコントロールプレーンとその料金体系に研究者を縛ってしまう。
マネージドサンドボックスに対するセルフホストの代替
Orchard論文は、EnvironmentサービスをE2B、Daytona、Modalといったマネージドプラットフォームや、MegaFlowのような統合研究システムと比較している。Microsoftの差別化点は制御性だ:Orchard Envは標準的なKubernetesクラスタ上でセルフホストでき、上位で動作するエージェントハーネスやトレーニングフレームワークから独立して利用できる。
Microsoftの提示したコスト数値は顧客請求額ではなく推定値である。研究者らは2026年4月に収集した価格を用いて、128個のサンドボックス(それぞれ2つの仮想CPUと8 GiBのメモリ)を240時間稼働させるワークロードをモデル化した。Orchard Envはオンデマンドインスタンスで$3,362、スポットキャパシティを使用した場合で$673と推定された。同じ論文は、モデル化されたワークロード下でE2BまたはDaytonaが$7,078、Modalが$10,305になると推定している。
これらの節約は、チームがKubernetesを運用し、ネットワークポリシーを設定し、スポットキャパシティを管理できることを前提としている。Orchardは支出をマネージドサンドボックスプロバイダから移行させるが、運用上の作業を取り除くわけではない。既にクラスタを運用している研究室やエージェント系スタートアップにとっては、同じインフラがデータ生成、強化学習のロールアウト、最終評価を処理できるため、そのトレードオフは魅力的になり得る。
GitHubリポジトリにはMITライセンスの下でOrchard Envのコードが含まれている。インターフェースはサンドボックスのライフサイクル管理、コマンド実行、ファイル入出力、パッチ適用、ネットワーク分離をカバーする。Microsoft Researchはテスト中にサービスが1,000個のサンドボックスを並列で起動し、成功率100%でプロセスを26秒で完了したと報告している。
3つのレシピが同じインフラをテスト
Microsoft Researchは、共有レイヤーが異なるエージェントをどのようにサポートできるかを示すために、3つのドメイン固有のレシピを公開した。Orchard-SWEはソフトウェアエンジニアリングエージェントを訓練し、Orchard-GUIはブラウザナビゲーションを対象とし、Orchard-Clawはメールやカレンダーといったツールを含む生産性作業を扱う。
Orchard-SWEでは、2,788のリポジトリにまたがる107,185のマルチターントラジェクトリを収集した。公開データセットには成功例と失敗例が含まれており、報酬モデリングや失敗解析のためのネガティブ例を研究者に提供する。論文は、約30億のアクティブパラメータを持つモデルを用いた場合にOrchard-SWEがSWE-bench Verifiedで69.7%を達成し、別のバリューモデルで複数の候補解を再ランキングすると73%に上昇したと報告している。
Orchard-GUIは400の蒸留デモンストレーションと2,200のオープンエンドな訓練タスクを使用した。Microsoft ResearchはWebVoyager、Online-Mind2Web、DeepShopにわたる平均成功率が68.4%であると報告している。Orchard-Clawは200の合成生産性タスクで訓練され、3回の試行を許可した場合に59.6%の合格率を達成し、ZeroClawハーネスと組み合わせると73.9%に上昇した。
これらのベンチマーク結果はOrchardの著者によって報告されており、異なるテストセット、ハーネス、推論設定にまたがるため、パーセンテージは3つのエージェントの単一のランキングを示すものではない。共通の結果はMicrosoftの中心的な主張を支持している:小規模なオープンウェイトモデルでも、ロールアウトを再利用し、現実的なハーネス内で訓練し、以前の実験を破棄せず保存することで、実質的な改善が得られる可能性がある。
Microsoftが5月に始まったプロジェクトをパッケージ化
8月3日のローンチは、既に公開され始めていた作業をパッケージ化したものだ。最初のOrchard論文は5月14日に提出され、現在の第3改訂は7月30日に投稿された。リポジトリによれば、Orchard Envとトラジェクトリデータセットは5月に到着し、6月にOpenWebRLの作業、7月にOpenForge RLが続いた。
このタイムラインが重要なのは、Microsoft Researchが単一のベンチマークモデルではなく、成長するインフラ層を公開しているためだ。ソフトウェア、データセット、レシピは外部チームに自分たちのクラスタ上でエージェント訓練を実行するための出発点を提供する。マネージドエージェントサンドボックスを販売するベンダーにとっても、Orchardは価格、レイテンシ、移植性の主張を検証できるオープンなリファレンス実装を作成する。