Simple AI publica 2,000 horas de datos de entrenamiento de robots recopilados sin brazos robóticos

El fundador Xiaofei Li está aplicando un playbook de datos de conducción autónoma a la manipulación, con afirmaciones limitadas de paridad construidas sobre más de 10 veces la cantidad de demostraciones humanas.

By · Published

Primary source: PR Newswire

Why it matters

Robot teleoperation makes manipulation data accurate and expensive. HiFi-UMI suggests portable human capture can substitute for it in some post-training pipelines, though Simple AI used more than 10 times as many demonstrations.

A thermal false-color image shows a human hand manipulating a small object, with scientific data readouts overlaid.

Xiaofei Li, fundador y CEO de Simple AI, publicó un conjunto de datos de robótica de 2,000 horas el 20 de agosto que elimina la necesidad de un robot objetivo o de teleoperación del robot durante la recolección de datos. El HiFi-UMI system registra a personas realizando tareas de manipulación bimanual con pinzas portátiles equipadas con sensores y luego convierte esas demostraciones en trayectorias para entrenar brazos robóticos reales.

El lanzamiento convierte una lección de la carrera de Li en conducción autónoma en un producto de robótica. Material público para inversores dice que Li obtuvo la licenciatura y el doctorado en Tsinghua University y ayudó a desarrollar una arquitectura de conducción autónoma L4 antes de fundar Simple AI. Su apuesta actual sigue el enfoque de bucle de datos que moldeó a los vehículos autónomos: recolectar comportamiento en entornos reales, automatizar el control de calidad, alimentar los datos resultantes a modelos y probar los modelos de nuevo en el mundo físico.

En un anuncio del 20 de agosto, Li dijo que Simple AI quería determinar si la fidelidad de los datos podría hacer que las demostraciones sin robot fueran aptas para entrenamiento orientado al despliegue. El informe técnico, publicado por primera vez el 28 de julio, reporta una paridad aproximada de rendimiento con la teleoperación convencional de robots a través de tres arquitecturas de política y cuatro grupos de tareas de mesa.

Una fábrica de datos sin el brazo robótico

La teleoperación de robots produce datos de entrenamiento útiles porque cada acción registrada ya refleja la geometría, los sensores y los límites físicos de una máquina específica. También ata cada hora de recolección a un brazo robótico, un equipo de control y un operador. Eso hace que la expansión a casas, hoteles, almacenes y otros entornos variados sea lenta y requiera mucho capital.

La Universal Manipulation Interface, un sistema de demostración humana sin robot presentado en un artículo de 2024 por investigadores afiliados a Stanford University, Columbia University y Toyota Research Institute, ofreció otra ruta. Sus pinzas de mano permiten a las personas demostrar tareas en entornos naturales sin transportar un robot a cada ubicación. La investigación de Simple AI se centra en los problemas de fidelidad restantes, incluida la exactitud de la trayectoria, la sincronización, la cobertura de las cámaras y la posición relativa de dos pinzas.

HiFi-UMI coloca una cámara estéreo y sensores inerciales en la cabeza del operador y dos cámaras ojo de pez no paralelas en cada módulo de mano. Simple AI reporta aproximadamente 3 milímetros de precisión local del efector final, sincronización de sensores por debajo de 40 microsegundos y alrededor de 200 grados de cobertura visual alrededor de cada mano. Un disparador de hardware compartido alinea las cámaras y los sensores inerciales.

Después de la captura, Simple AI reconstruye cada trayectoria e intenta reproducirla en simulación. Simple AI reporta tasas de aprobación de aproximadamente 98% tanto para la reconstrucción de trayectorias como para la validación de reproducción en simulación en sus materiales de lanzamiento. Este paso de rechazo automatizado importa comercialmente porque la recolección más barata pierde gran parte de su ventaja si los ingenieros deben reparar o inspeccionar manualmente cada episodio.

El conjunto de datos HiFi-UMI-2K contiene 2,000 horas y más de 482,000 episodios recolectados en más de 110 escenas, según su ficha del conjunto de datos. Incluye video sincronizado multi-vista, trayectorias bimanuales, estados de las pinzas, anotaciones en lenguaje, límites de subtareas y metadatos de control de calidad. Simple AI lo lanzó bajo la licencia CC BY 4.0, que permite uso comercial con atribución.

HiFi-UMI-2K representa menos de una décima parte del corpus más grande que Simple AI dice haber procesado. Los materiales del proyecto afirman más de 20,000 horas y 4.32 millones de episodios recolectados en más de 480 escenas. Abrir 2,000 horas da a investigadores externos suficiente material para entrenar y evaluar modelos mientras deja la mayor parte del corpus reportado sin publicar.

La afirmación de paridad tiene un denominador

El informe evalúa tres backbones de política que abarcan los enfoques vision-language-action y world-action-model, a través de cuatro tareas bimanuales de mesa. En comparación con políticas post-entrenadas con datos de teleoperación de robots, las políticas basadas únicamente en HiFi-UMI produjeron diferencias agregadas en la tasa de éxito de -2.5, +3.1 y -0.6 puntos porcentuales, respectivamente.

En una tarea de inserción de precisión, la política más fuerte entrenada solo con HiFi-UMI alcanzó 85% de éxito. La línea base de teleoperación tenía una aparente ventaja ambiental porque sus demostraciones se recolectaron en la escena de evaluación, mientras que los ejemplos sin robot provinieron de otras ubicaciones.

Esos resultados requieren un denominador cuidadoso. Las comparaciones vision-language-action usaron alrededor de 3,200 trayectorias HiFi-UMI por tarea y aproximadamente 300 trayectorias de teleoperación. Por lo tanto, Simple AI utilizó más de 10 veces más demostraciones sin robot. La prueba comercial relevante es si esas demostraciones humanas adicionales son lo suficientemente más baratas y rápidas de producir. La eficiencia de datos por trayectoria sigue sin resolverse.

El robot usado para la evaluación también compartía la configuración de la pinza y la cámara de muñeca del sistema de captura. Su cinemática de brazo difirió, pero la prueba no abarcó manos, diseños de sensores o cuerpos de robot radicalmente diferentes. Los autores limitan su conclusión a los modelos, tareas y condiciones probadas. HiFi-UMI aporta evidencia de que el ancla de post-entrenamiento con robot real puede eliminarse en este montaje, más que un hallazgo general de que los modelos de manipulación ya no necesitan datos generados por robots.

Los resultados de pre-entrenamiento apuntan hacia un segundo uso para la operación de datos de Li. Simple AI dice que pre-entrenar una política con 4,000 horas del corpus más amplio redujo el error promedio de predicción de acción offline en 41% a través de 10 tareas no vistas. En la configuración evaluada StarVLA-QwenPI, aumentó el éxito en robot real en 18.1 puntos porcentuales cuando la cantidad de datos de post-entrenamiento específicos de la tarea se mantuvo constante.

Li está construyendo el bucle de datos antes del robot doméstico

Simple AI tiene su sede en Beijing. Li ha planteado la IA incorporada como una industria que pasa de demostraciones técnicas hacia productos repetibles y despliegue, una transición que él observó previamente en la conducción autónoma.

El capital ha seguido esa tesis, aunque el registro público de financiamiento es difícil de reconciliar. Un informe de abril de 2026 describió una ronda separada de varios cientos de millones de yuanes liderada por Linear Capital y Puhua Capital, con la participación de Junshan Capital, Shunwei Capital y BV Baidu Ventures. Informes de financiamiento separados de junio describieron una ronda Pre-A de varios cientos de millones de yuanes respaldada por Didi, Plum Ventures, Col Capital, Linear Capital, CCV y Puhua Capital, pero el material disponible no establece un inversor líder ni cómo se relacionan las dos rondas.

El lanzamiento de HiFi-UMI muestra a dónde va parte de ese capital. Simple AI está ensamblando hardware de captura, software de reconstrucción, anotación, validación por simulación, entrenamiento de modelos y despliegue de robots en una sola cadena de producción.

El campo competitivo ya se está dividiendo entre la recolección centrada en robots y la recolección sin robots. El DROID dataset utiliza recolección basada en robots y equipo de teleoperación, mientras que proveedores comerciales como Trillion Robotics están vendiendo hardware UMI portátil de mano. Simple AI apuesta a que un sensorado más fino y la reproducción automatizada pueden hacer que las demostraciones portátiles sean lo suficientemente precisas para la etapa final de entrenamiento específica de la tarea.

Liberar 2,000 horas bajo una licencia permisiva también es un movimiento de distribución. Si los investigadores adoptan el formato, reproducen los resultados o construyen herramientas de entrenamiento alrededor de HiFi-UMI, el método de recolección de Simple AI ganará credibilidad más allá de sus propios robots. El corpus más grande que Simple AI dice haber procesado podría entonces volverse más valioso como una extensión de un estándar público emergente.

El logro inmediato de Li es más limitado y más útil que la amplia promesa de un robot doméstico. Simple AI ha construido un sistema sustancial de producción de datos y publicado un benchmark que muestra que, bajo condiciones controladas, las personas que llevan pinzas pueden generar supervisión de alta fidelidad suficiente para entrenar a un robot sin operarlo durante la recolección. La economía de esa sustitución, y su capacidad para funcionar con distintos hardware y en tareas que impliquen mucho contacto, determinarán si HiFi-UMI se convierte en infraestructura o en otro sólido resultado de laboratorio.

Reader comments

Conversation for this story loads after sign-in.