Bedrock-RLはMinecraftを視覚・言語エージェントの訓練に十分再現可能にする
このオープンソースのフレームワークは、研究者がモデルやトレーナーを入れ替えてもワールドと報酬を固定したままにし、MinecraftのVLM実験を再現可能にすることを目的としている。
By RuntimeWire Staff · Published
Primary source: Hugging Face
Why it matters
Bedrock-RL turns Minecraft agent work into a more controlled experiment, giving researchers reproducible worlds, fixed verifiers and traceable training data across models and methods.

Michael Evans、Old Dominion University の大学院研究者は、8月19日付の Hugging Face コミュニティ記事で Bedrock-RL を詳述し、強化学習のために Minecraft 実験を再現可能にすることを目的としたオープンソースのフレームワークを提示した。
Bedrock-RL リポジトリ は Evans の GitHub アカウントでホストされ、MIT ライセンスで公開されており、決定論的な Minecraft シミュレーション、分散トレーニング基盤、およびタスク検証システムを視覚言語モデル向けに一つのスタックにまとめている。Hugging Face の記事は Evans とともに数名のコミュニティ貢献者にクレジットを与えている。
Evans は、再現性がリーダーボードを超えた影響を持つ研究背景からこの問題に取り組んだ。彼の履歴書によれば、彼は電気・コンピュータ工学の修士課程に在籍しており、Old Dominion University の Vision Lab でマルチモーダル医療画像を研究している。彼の研究には、アルツハイマー病研究のパイプライン、脳腫瘍のセグメンテーション、地域的な脳グルコース低代謝の予測が含まれる。彼は以前、大規模言語モデルによる科学的主張の検証や自律走行車のシミュレーションにも取り組んでいた。
その経歴は Bedrock-RL の定義上の関心事を説明する助けになる。すなわち、モデルの結果は、それを生み出した世界・観測・意思決定の連鎖に追跡可能であるべきだという点である。
再現性が成果である
Minecraft は、視覚的知覚、ナビゲーション、道具の使用、計画、および数百〜数千の行動にまたがる目的を組み合わせるため、長く AI 研究者の注目を集めてきた。しかし標準的な Java クライアントは扱いにくいトレーニング基盤を作る。Bedrock-RL の著者らはそれを遅く、非決定論的で、多数の並列ロールアウトで実行するのが難しいと表現している。
Bedrock-RL は、Minecraft 1.11.2 を決定論的に再実装した C/CUDA 製の Netherite と、ByteDance の Seed チームが始めた分散強化学習フレームワーク verl を組み合わせる。Netherite のリポジトリは 1 GPU 当たり最大 7,200 のロックステップワールドをサポートすると主張している。Bedrock-RL はそのエンジンをトレーニングと評価ツールの下にある制御された環境として利用する。
研究者は世界、指示、行動予算、報酬を YAML で記述する。Bedrock-RL はその後、異なるシードを用いてトレーニング、開発、テストの各エピソードを生成できる。保存された各軌跡は世界シード、意思決定シード、スナップショットハッシュ、出所を保持し、研究者が不完全なログから再構築するのではなくエピソードを再生するために必要な入力を与える。
アーキテクチャはタスク、視覚表現、ツール、コンテキストポリシー、教師の指導、データパイプライン、モデル、トレーナーといった実験を置き換え可能なレイヤーに分割する。研究者はレンダラーや学習手法を変更しても、基礎となるタスクと検証器を保持できる。サポートされる手法には GRPO、RLOO、REINFORCE++、ReMax、教師ありファインチューニング、および複数の蒸留形式が含まれる。
この分離は重要だ。というのも、モデルの変更が環境ラッパー、プロンプト、報酬、評価ハーネスも同時に変えてしまうとエージェントベンチマークは動く標的になり得るからだ。Bedrock-RL はトレーニング手法にかかわらず検証器を固定したままにする。報酬チェックはライブのエンジン状態を読み取るため、成功はエージェントが実際にアイテムを選択したか、資源を回収したか、構造物に到達したかに依存でき、生成されたテキストがそう主張したかどうかに依存しない。
Evans と寄与者たちは合成デモに対するガードレールも作った。スクリプト化されたエキスパートポリシーは完全なボクセルマップを参照できる一方で、視覚言語モデルはフレームしか受け取らないかもしれない。Bedrock-RL は各エキスパートの決定がモデルに利用可能な情報に基づいていたかを記録し、特権的な行動はデフォルトで拒否する。例えば、見えない地下の鉄鉱石に基づくルートは、その鉱石を観測できなかったエージェントの行動模倣ターゲットにすべきではない。
有用な節度を持った小規模テスト
付属のトレーニング例では、Qwen3-VL 2B に対してランダム化された 9 個のホットバーアイテムから鉄のツルハシを選択させる。Bedrock-RL は変更を加えていないベースモデルを 10 ステップの GRPO でトレーニングし、各チェックポイントを 288 の固定された開発プロンプトに対して評価する。
温度ゼロでは、ベースモデルは 288 プロンプト中 27 件、つまり 9.4% に成功した。ステップ10 のチェックポイントは 39 件、つまり 13.5% に成功した。報告されたペアの完全検定の p 値は 0.169 であり、その単一試行の増分は統計的に決定的ではなかった。
各プロンプトに対して確率的に3回試行すると、pass@3 は 288 中 31 件(10.8%)から 64 件(22.2%)に増加した。Bedrock-RL はその結果について 37 件のペア改善、4 件の後退、および p 値 1.03 x 10^-7 を報告している。
著者らはこの実行をエンドツーエンドのパイプラインチェックとして提示している。彼らは開発チェックポイントが選択基準を満たさなかったため、封印されたテスト分割を閉じたままにした。その決定は、10 ステップのトレーニングからベンチマーク主張を無理に絞り出すよりも有益な情報を与える:Bedrock-RL は評価の規律を研究者が覚えておくべき慣習ではなくフレームワークの一部にしようとしている。
この例は、機構が動作することを示しているにすぎず、Minecraft に対する広範な能力を示すものではない。ホットバーアイテムを選ぶことは、長期のナビゲーション、クラフティング、戦闘、建築とは程遠い。Bedrock-RL が注目されるのは、それらより困難なタスクも同じ制御されたシステム内で表現できるからだ。
Minecraft に別の研究スタックが登場
Bedrock-RL は長い歴史を持つ分野に加わる。Microsoft の Project Malmo は強化学習やその他の AI 研究向けの Minecraft ベースの実験プラットフォームを提供してきた。MineDojo は数千のタスクと Minecraft 資料から構築された大規模な知識ベースを集めた。Voyager は GPT-4、自動カリキュラム、および増え続ける実行可能なスキルのライブラリを使って継続的に探索するエージェントを作成した。Craftax は Minecraft に触発された JAX 環境でより高速なオープンエンド強化学習を追求した。
Bedrock-RL の貢献はより狭く、トレーニングループに近い。研究者に決定論的なシミュレーション、シード制御されたデータ生成、そして VLM ポリシーや学習手法を比較するための不変の検証器を提供する。設計は、Minecraft を成功した実行がその結果となるデモ環境ではなく、制御された実験のためのインフラとして扱っている。
Evans にとって、このプロジェクトは医療画像や科学的検証から具現化エージェント工学への大きな拡張を示すものでもある。彼の以前の仕事は、ノイズの多い科学データから弁護可能な結論を引き出すことに集中していた。Bedrock-RL は同じ本能を手に負えない仮想世界に適用している:条件を記録し、開発とテストを分離し、主張された成功のすべてを再生可能にすることだ。
このフレームワークは依然として、意味のある長期タスクや貢献者以外の研究グループで自身を証明する必要がある。だがその最も強力な初期の主張はすでにコードに見えている。Bedrock-RL はエージェント研究の地味な部分――シード、検証器、出所、拒否された軌跡――を第一級の構成要素にしている。これらは通常、ある結果が別の研究室との接触に耐えられるかどうかを決定する部分である。