Bedrock-RL 使 Minecraft 具有足够的可重复性,可用于训练视觉-语言智能体
这个开源框架在研究人员交换模型和训练器时保持世界和奖励不变,旨在使 Minecraft VLM 实验可复现。
By RuntimeWire Staff · Published
Primary source: Hugging Face
Why it matters
Bedrock-RL turns Minecraft agent work into a more controlled experiment, giving researchers reproducible worlds, fixed verifiers and traceable training data across models and methods.

Michael Evans,Old Dominion University 的一名研究生, 在一篇 8月19日的 Hugging Face 社区文章 中详细介绍了 Bedrock-RL,提出了一个开源框架,旨在使 Minecraft 实验对强化学习来说具有足够的可重复性。
Bedrock-RL 仓库 托管在 Evans 的 GitHub 账户下并以 MIT 许可证发布,它将一个确定性 Minecraft 仿真、分布式训练基础设施和任务验证系统打包为面向视觉-语言模型的一体化堆栈。Hugging Face 文章在致谢中把若干社区贡献者列在 Evans 之外。
Evans 从一个注重可复现性的研究背景出发,那里可复现性带来的后果超出了排行榜的范畴。根据他的 curriculum vitae,他在 Old Dominion 的 Vision Lab 攻读电气与计算机工程硕士学位,并研究多模态医学影像。他的工作包括用于阿尔茨海默病研究的管线、脑肿瘤分割以及区域性脑葡萄糖代谢减低的预测。他此前从事过基于大型语言模型的科学声明验证和自动驾驶仿真相关工作。
这一经历有助于解释 Bedrock-RL 的核心关切:模型的结果应当可以追溯到产生该结果的世界、观测与决策序列。
可重复性是产品
Minecraft 长期吸引 AI 研究人员,因为它结合了视觉感知、导航、工具使用、规划以及可能跨越数百或数千步的目标。然而,标准的 Java 客户端会产生一个尴尬的训练底层:作者们描述它为慢、不确定且难以在许多并行 rollout 上运行。
Bedrock-RL 将 Netherite,一个确定性的 C/CUDA 重实现的 Minecraft 1.11.2,与由 ByteDance 的 Seed 团队发起的分布式强化学习框架 verl 结合起来。Netherite 的仓库声称在一块 GPU 上支持多达 7,200 个锁步世界。Bedrock-RL 使用该引擎作为其训练与评估工具之下的受控环境。
研究者在 YAML 中描述一个世界、指令、动作预算和奖励。Bedrock-RL 然后可以使用互不重合的 seed 生成独立的训练、开发和测试剧本。每条保存的轨迹都带有其世界 seed、决策 seed、快照哈希和来源信息,为研究者提供了回放一个剧本所需的输入,而不是从不完整的日志中重构它。
该架构将实验划分为可替换的层:任务、视觉表示、工具、上下文策略、教师引导、数据管线、模型和训练器。研究者可以在保持底层任务与验证器不变的情况下更换渲染器或学习方法。支持的方法包括 GRPO、RLOO、REINFORCE++、ReMax、监督微调以及若干形式的蒸馏。
这种分离很重要,因为当模型的改变同时改变了环境包装器、提示、奖励或评估工具时,代理基准可能会变成移动目标。Bedrock-RL 在不同训练方法之间保持验证器不变。奖励检查读取实时引擎状态,因此成功与否可以取决于代理是否真实地选择了某个物品、收集了资源或到达了某个结构,而不是取决于其生成的文本是否声称完成了这些动作。
Evans 和贡献者们还为合成示范建立了护栏。脚本化的专家策略可能能看到完整的体素地图(voxel map),而视觉-语言模型只接收帧图像。Bedrock-RL 记录每个专家决策是否基于模型可获得的信息,并默认拒绝特权动作。例如,基于看不见的地下铁矿的路径不应成为一个不能观察到矿石的代理的行为克隆目标。
一个带有有益克制的小测试
附带的训练示例要求 Qwen3-VL 2B 从九个随机化的快捷栏物品中选择一把铁镐。Bedrock-RL 在未修改的基础模型上训练 10 个 GRPO 步,并针对 288 条冻结的开发提示评估每个检查点。
在温度为零的情况下,基础模型在 288 个提示中成功 27 次,即 9.4%。第 10 步检查点成功 39 次,即 13.5%。报告的配对精确 p 值为 0.169,使得那一次尝试的提升在统计上不具决定性。
在每个提示进行三次随机尝试时,pass@3 从 288 中的 31 次(即 10.8%)上升到 288 中的 64 次(即 22.2%)。Bedrock-RL 报告了 37 次配对提升、4 次回退,并为该结果给出 p 值 1.03 x 10^-7。
作者将该运行呈现为一个端到端的管线检查。他们保留了封闭的测试拆分,因为没有任何开发检查点满足他们的选择标准。与从 10 个训练步中挤出一个基准声明相比,这一决定更有信息量:Bedrock-RL 试图将评估纪律性作为框架的一部分,而不是作为研究者被期望记住的惯例。
该示例证明了机械装置能够运行,而不是展示广泛的 Minecraft 能力。选择快捷栏物品与长期航行、合成、战斗或建造相去甚远。Bedrock-RL 之所以受关注,是因为那些更难的任务可以在相同的受控系统中被表达出来。
Minecraft 又多了一个研究栈
Bedrock-RL 进入的是一个有着悠久历史的领域。Microsoft 的 Project Malmo 为强化学习和其他 AI 研究提供了一个基于 Minecraft 的试验平台。MineDojo 汇集了成千上万的任务和一个从 Minecraft 材料中抽取的大型知识库。Voyager 利用 GPT-4、自动课程和不断扩展的可执行技能库来创建一个持续探索的代理。Craftax 在受 Minecraft 启发的 JAX 环境中追求更快的开放式强化学习。
Bedrock-RL 的贡献更窄、更接近训练环路。它为研究者提供了一个确定性仿真、基于 seed 的数据生成以及一个不变的验证器,用于比较 VLM 策略和学习方法。该设计将 Minecraft 视为受控实验的基础设施,而不是一个在成功运行后就成为结果展示的演示环境。
对 Evans 来说,该项目也标志着从医学影像和科学验证向具身代理工程的一次实质性扩展。他之前的工作侧重于从嘈杂的科学数据中提取可辩护的结论。Bedrock-RL 将同样的直觉应用到一个难以驾驭的虚拟世界:记录条件、将开发与测试分离并使每一个声称的成功都可回放。
该框架仍需在有意义的长期任务上以及在贡献者基础之外的研究小组中证明其价值。它目前最有力的早期论点已经在代码中可见。Bedrock-RL 将代理研究中不那么光鲜的部分——seed、验证器、来源信息和被拒绝的轨迹——设为一等公民组成部分。这些通常是决定一个结果能否经得起其他实验室验证的关键部分。