Xiaomi publica como código abierto un modelo robótico 5B entrenado con 100,000 horas de datos UMI
La versión con licencia Apache incluye los pesos, el código de posentrenamiento y las herramientas de despliegue, mientras Xiaomi mantiene privado el corpus de entrenamiento principal.
By Ryan Merket · Published
Primary source: X / Xiaomi Tech
Why it matters
Xiaomi is giving robotics teams a reusable 5B policy and adaptation stack, while keeping control of the large proprietary dataset behind its performance claims.

Xiaomi ha publicado el código y los pesos de Xiaomi-Robotics-1, un modelo vision-language-action de 5 mil millones de parámetros diseñado para controlar robots a partir de imágenes e instrucciones en lenguaje natural. Xiaomi Tech (@XiaomiTech_) dio a conocer el paquete de código abierto el 5 de agosto, dos días después de que el repositorio del proyecto registrara la liberación de su pipeline de post-entrenamiento, inferencia y evaluación de benchmarks.
La liberación convierte un anuncio de investigación de julio en un artefacto que los equipos de robótica pueden inspeccionar y adaptar. Xiaomi publicó el informe técnico inicial el 16 de julio, describiendo un modelo preentrenado con más de 100,000 horas de trayectorias de Universal Manipulation Interface, o UMI. Los sistemas UMI permiten a las personas demostrar tareas de manipulación con hardware de mano tipo pinza, lo que hace que la recolección de datos dependa menos de operar un robot específico.
Esa distinción define la apuesta central de Xiaomi. La cifra de 100,000 horas representa trayectorias de manipulación generadas por humanos en lugar de 100,000 horas de operación autónoma de robots. Xiaomi dice que el corpus abarca más de 1,700 escenarios en hogares, locales comerciales, sitios industriales y entornos al aire libre. Un sistema automatizado de visión y lenguaje dividió las grabaciones en clips y etiquetó cambios en escenas, objetos y movimientos de la pinza.
Xiaomi luego utilizó más de 10,000 horas de datos cross-embodiment para alinear esas acciones aprendidas con robots físicos e instrucciones directas. Esa mezcla de post-entrenamiento incluyó más de 7,200 horas de datos internos de robots recopilados en hogares, junto con conjuntos de datos públicos filtrados y trayectorias UMI anotadas manualmente, según el informe.
What Xiaomi released
El checkpoint de 5B está disponible bajo la licencia Apache 2.0. Xiaomi también publicó código para adaptar el checkpoint a nuevos datos de robots, ejecutar un servidor de inferencia y evaluar versiones afinadas para RoboCasa, RoboCasa365 y VLABench. Checkpoints de benchmark separados se recopilan en Hugging Face.
El paquete está dirigido a investigadores en robótica con sus propios datos y trabajo de integración de hardware por delante. Las instrucciones de despliegue de Xiaomi requieren Python 3.9 o posterior, una GPU CUDA y la versión 4.57.1 de Hugging Face Transformers. El modelo usa Qwen3-VL-4B-Instruct como su backbone vision-language y acepta tres imágenes de cámara, una instrucción en lenguaje y el estado actual del robot. Su salida contiene comandos de acción para componentes que incluyen brazos duales y pinzas.
Xiaomi proporciona un conjunto de datos de demostración que muestra el formato esperado de post-entrenamiento. El corpus principal de UMI de 100,000 horas y las más de 7,200 horas de grabaciones internas de robots quedan fuera del paquete publicado. Equipos externos pueden afinar y desplegar el checkpoint, aunque no pueden reconstruir la ejecución completa de entrenamiento de Xiaomi a partir del material liberado.
Ese límite importa porque el conjunto de datos es el activo central de la investigación. El artículo dice que Xiaomi-Robotics-1 mejoró a medida que los investigadores aumentaron tanto los datos de entrenamiento como la cantidad de parámetros, con las aumentos de datos produciendo ganancias más pronunciadas en la precisión de predicción de acciones que los incrementos en el tamaño del modelo. Abrir el pipeline de adaptación da a otros laboratorios una manera de probar la política resultante, mientras Xiaomi conserva la operación de recopilación que produjo su ventaja declarada.
Xiaomi's benchmark claims
Xiaomi informa que Xiaomi-Robotics-1 alcanzó una tasa de éxito promedio del 75% en empaquetado de teléfonos, recarga de impresoras, carga de lavandería y empaquetado de cajas después de recibir en promedio menos de 10 horas de demostraciones por tarea. Una línea base pi-0.5 alcanzó 40% con el mismo presupuesto de datos. Con menos de 40 horas por tarea en promedio, Xiaomi reportó tasas de éxito del 85% para Xiaomi-Robotics-1 y 53% para pi-0.5.
Esas cifras provienen de experimentos propios de Xiaomi. El equipo de investigación evaluó cada modelo en 10 ensayos por tarea, dejando un número relativamente pequeño de intentos detrás de cada porcentaje. El código de evaluación y los checkpoints publicados deberían facilitar examinar los resultados de simulación, mientras que reproducir las afirmaciones sobre robots reales aún requiere máquinas compatibles, configuraciones de tarea y datos de demostración.
Xiaomi también reporta tasas de éxito promedio de 74.5% en RoboCasa, 57.4% en RoboCasa365 y 59.1% en VLABench. Xiaomi lista una tasa de éxito promedio de 13.93% para RoboDojo en la tabla del proyecto, mientras que el artículo reporta por separado una puntuación promedio de RoboDojo de 20.07. Las métricas miden salidas diferentes y no deben tratarse como intercambiables.
Xiaomi-Robotics-1 sigue a Xiaomi-Robotics-0, un modelo vision-language-action de 4.7 mil millones de parámetros presentado en febrero. Xiaomi publicó el pipeline completo de post-entrenamiento del modelo anterior en abril. Xiaomi-Robotics-1 amplía ese enfoque en torno a una colección UMI mucho mayor y una receta de entrenamiento en dos etapas modelada en la estructura de pre-entrenamiento y alineación usada para modelos de lenguaje.
El paquete de código abierto da a los equipos de robótica un checkpoint utilizable en lugar de otra demostración solo en video. La ventaja estratégica de Xiaomi sigue estando aguas arriba: recopilar, etiquetar y alinear suficientes datos del mundo físico para hacer que políticas generales de robot sean útiles a través de nuevas tareas y máquinas.