Bedrock-RL hace que Minecraft sea lo suficientemente repetible para entrenar agentes de visión y lenguaje
El marco de código abierto mantiene los mundos y las recompensas fijos mientras los investigadores intercambian modelos y entrenadores, con el objetivo de que los experimentos de VLM en Minecraft sean reproducibles.
By RuntimeWire Staff · Published
Primary source: Hugging Face
Why it matters
Bedrock-RL turns Minecraft agent work into a more controlled experiment, giving researchers reproducible worlds, fixed verifiers and traceable training data across models and methods.

Michael Evans, un investigador de posgrado en Old Dominion University, detalló Bedrock-RL en un artículo de la comunidad de Hugging Face del 19 de agosto, exponiendo un marco de código abierto diseñado para que los experimentos en Minecraft sean lo suficientemente reproducibles para el aprendizaje por refuerzo.
El repositorio Bedrock-RL, alojado en la cuenta de GitHub de Evans y publicado bajo una licencia MIT, empaqueta una simulación determinista de Minecraft, infraestructura de entrenamiento distribuido y un sistema de verificación de tareas en una sola pila para modelos visión-lenguaje. El artículo de Hugging Face acredita a varios colaboradores de la comunidad además de Evans.
Evans llegó al problema desde un trasfondo de investigación donde la reproducibilidad tiene consecuencias más allá de un ranking. Según su currículum vitae, está cursando una maestría en ingeniería eléctrica y de computadoras y estudia imágenes médicas multimodales en el Vision Lab de Old Dominion. Su trabajo ha incluido flujos de trabajo para investigación de la enfermedad de Alzheimer, segmentación de tumores cerebrales y predicción del hipometabolismo regional de glucosa en el cerebro. Anteriormente trabajó en la verificación de afirmaciones científicas con modelos de lenguaje grandes y en simulación de vehículos autónomos.
Ese historial ayuda a explicar la preocupación definitoria de Bedrock-RL: el resultado de un modelo debe ser trazable al mundo, a la secuencia de observación y decisión que lo produjo.
La repetibilidad es el resultado
Minecraft ha atraído desde hace tiempo a los investigadores de IA porque combina percepción visual, navegación, uso de herramientas, planificación y objetivos que pueden abarcar cientos o miles de acciones. Sin embargo, el cliente Java estándar crea un sustrato de entrenamiento torpe. Los autores de Bedrock-RL lo describen como lento, no determinista y difícil de ejecutar en muchas ejecuciones paralelas.
Bedrock-RL acopla Netherite, una reimplementación determinista en C/CUDA de Minecraft 1.11.2, con verl, el framework de aprendizaje por refuerzo distribuido iniciado por el equipo Seed de ByteDance. El repositorio de Netherite afirma soporte para hasta 7,200 mundos sincronizados en lockstep en una GPU. Bedrock-RL usa ese motor como el entorno controlado debajo de sus herramientas de entrenamiento y evaluación.
Los investigadores describen un mundo, una instrucción, un presupuesto de acciones y una recompensa en YAML. Bedrock-RL puede entonces producir episodios separados de entrenamiento, desarrollo y prueba usando semillas disjuntas. Cada trayectoria guardada lleva su semilla del mundo, semilla de decisión, hash de la instantánea y procedencia, proporcionando a los investigadores las entradas necesarias para reproducir un episodio en vez de reconstruirlo a partir de un registro incompleto.
La arquitectura divide un experimento en capas reemplazables para la tarea, representación visual, herramientas, política de contexto, guía del profesor, pipeline de datos, modelo y entrenador. Un investigador puede cambiar el renderer o el método de aprendizaje conservando la tarea subyacente y el verificador. Los métodos soportados incluyen GRPO, RLOO, REINFORCE++, ReMax, ajuste fino supervisado y varias formas de destilación.
Esa separación importa porque los benchmarks de agentes pueden convertirse en objetivos móviles cuando cambios en el modelo también alteran el envoltorio del entorno, los prompts, las recompensas o el arnés de evaluación. Bedrock-RL mantiene el verificador fijo entre métodos de entrenamiento. Las comprobaciones de recompensa leen el estado en vivo del motor, por lo que el éxito puede depender de si el agente realmente seleccionó un objeto, recogió un recurso o llegó a una estructura, en lugar de si su texto generado afirmaba que lo había hecho.
Evans y los colaboradores también construyeron una salvaguarda para demostraciones sintéticas. Las políticas expertas guionizadas pueden ver un mapa completo de vóxeles, mientras que un modelo visión-lenguaje recibe fotogramas. Bedrock-RL registra si cada decisión experta se fundamentó en información disponible para el modelo y rechaza por defecto acciones privilegiadas. Una ruta basada en hierro subterráneo no visto, por ejemplo, no debería convertirse en un objetivo de clonación de comportamiento para un agente que no pudo observar la mena.
Una prueba pequeña con contención útil
El ejemplo de entrenamiento incluido le pide a Qwen3-VL 2B que seleccione un pico de hierro de nueve elementos aleatorizados en la hotbar. Bedrock-RL entrena el modelo base sin modificar durante 10 pasos de GRPO y evalúa cada checkpoint contra 288 prompts de desarrollo congelados.
A temperatura cero, el modelo base tuvo éxito en 27 de 288 prompts, o 9.4%. El checkpoint del paso 10 tuvo éxito en 39, o 13.5%. El valor p exacto pareado reportado fue 0.169, dejando esa mejora en un solo intento estadísticamente inconclusa.
Con tres intentos estocásticos por prompt, pass@3 aumentó de 31 de 288, o 10.8%, a 64 de 288, o 22.2%. Bedrock-RL reporta 37 mejoras apareadas, cuatro regresiones y un valor p de 1.03 x 10^-7 para ese resultado.
Los autores presentan la ejecución como una comprobación de pipeline de extremo a extremo. Mantuvieron la partición de prueba sellada cerrada porque ningún checkpoint de desarrollo cumplió su estándar de selección. Esa decisión es más informativa que exprimir una afirmación de benchmark a partir de 10 pasos de entrenamiento: Bedrock-RL intenta que la disciplina de evaluación sea parte del marco en lugar de una convención que se espera que los investigadores recuerden.
El ejemplo establece que la maquinaria funciona más que demostrar una competencia amplia en Minecraft. Seleccionar un elemento de la hotbar está lejos de la navegación de largo horizonte, la fabricación, el combate o la construcción. Bedrock-RL atrae atención porque esas tareas más difíciles pueden expresarse dentro del mismo sistema controlado.
Minecraft recibe otra pila de investigación
Bedrock-RL entra en un campo con una larga historia. Project Malmo proporcionó una plataforma de experimentación basada en Minecraft para aprendizaje por refuerzo y otras investigaciones de IA. MineDojo ensambló miles de tareas y una gran base de conocimiento extraída de material de Minecraft. Voyager usó GPT-4, un currículo automático y una biblioteca creciente de habilidades ejecutables para crear un agente en continua exploración. Craftax persiguió un aprendizaje por refuerzo de código abierto más rápido y de desarrollo abierto en un entorno JAX inspirado en Minecraft.
La contribución de Bedrock-RL es más estrecha y más cercana al bucle de entrenamiento. Ofrece a los investigadores una simulación determinista, generación de datos controlada por semillas y un verificador sin cambios para comparar políticas de VLM y métodos de aprendizaje. El diseño trata a Minecraft como infraestructura para experimentos controlados en lugar de un entorno de demostración donde una ejecución exitosa se convierte en el resultado.
Para Evans, el proyecto también marca una expansión sustancial desde imágenes médicas y verificación científica hacia la ingeniería de agentes encarnados. Su trabajo previo se centró en extraer conclusiones defendibles de datos científicos ruidosos. Bedrock-RL aplica el mismo instinto a un mundo virtual indómito: registrar las condiciones, separar desarrollo de pruebas y hacer que cada éxito reclamado sea reproducible.
El framework aún tiene que probarse en tareas significativas de largo horizonte y a través de grupos de investigación fuera de su base de colaboradores. Su argumento inicial más fuerte ya es visible en el código. Bedrock-RL convierte las partes poco glamurosas de la investigación de agentes —semillas, verificadores, procedencia y trayectorias rechazadas— en componentes de primera clase. Esas suelen ser las partes que determinan si un resultado sobrevive al contacto con otro laboratorio.