La veterana de investigación de NVIDIA, Sanja Fidler, lanza Veeda AI para modelos del mundo de robots

El ex vicepresidente de investigación de IA de NVIDIA está construyendo Veeda junto con Zan Gojcic y Huan Ling en torno a entornos simulados para agentes encarnados.

By · Published

Primary source: X

Why it matters

A team that helped shape NVIDIA's world-model research is now trying to own the model layer independently, betting simulated interaction will supply the training scale that robotics still lacks.

NVIDIA research veteran Sanja Fidler launches Veeda AI for robot world models — The former NVIDIA AI research vice president is building Veeda with Zan Gojcic and Huan Ling around simulated environments for embodied agents.

Sanja Fidler (@FidlerSanja) lanzó Veeda AI el miércoles junto con colaboradores de larga trayectoria Zan Gojcic (@ZGojcic) y Huan Ling (@HuanLing6), formando un nuevo laboratorio de IA para construir modelos del mundo que puedan entrenar robots dentro de entornos físicos generados.

Fidler presentó Veeda AI en una publicación en X el 19 de agosto. El lanzamiento le da un nombre de empresa y un hogar comercial a la tesis de modelos del mundo que desarrolló durante ocho años en NVIDIA: los robots requerirán simulaciones realistas e interactivas en las que puedan actuar, fallar y adaptarse repetidamente antes de que sus políticas se desplieguen en el hardware.

De la investigación en NVIDIA a una startup

Fidler anunció el 31 de julio que dejaría NVIDIA, donde dirigió su operación de investigación en IA en Toronto y ascendió a vicepresidenta de investigación en IA. Permanece como profesora asociada en la University of Toronto y fue miembro cofundador del Vector Institute. Su investigación se ha centrado en visión por computadora, comprensión de escenas 3D, simulación y modelos multimodales, según su perfil de la University of Toronto.

Los otros fundadores de Veeda extienden ese trabajo en reconstrucción, modelos generativos y los sistemas de datos necesarios para entrenarlos. Gojcic dirigió la investigación de NVIDIA en Zúrich sobre reconstrucción neuronal y simulación generativa del mundo para la IA física. Obtuvo su doctorado en visión por computadora 3D en ETH Zurich y trabajó anteriormente como investigador visitante en Stanford.

Ling completó su doctorado en la University of Toronto bajo la supervisión de Fidler y más tarde se convirtió en gerente de investigación en NVIDIA. Sus equipos trabajaron en modelos generativos del mundo y modelos fundacionales de alta fidelidad, incluidas contribuciones a NVIDIA Cosmos, la plataforma del fabricante de chips para construir y adaptar modelos que simulan entornos físicos.

Los tres fundadores ya han pasado años publicando y construyendo juntos. Esa historia compartida le da a Veeda una base técnica que abarca generación de video, reconstrucción 3D, simulación e infraestructura de entrenamiento, en lugar de un equipo fundador ensamblado alrededor del actual ciclo de financiamiento de robótica.

La apuesta por modelos del mundo

Veeda dice que está desarrollando modelos fundacionales multimodales del mundo que simulan la realidad física, con el objetivo de crear entornos donde agentes de IA encarnados puedan aprender mediante la interacción. Su tesis pública es directa: el aprendizaje por imitación a partir de comportamiento humano grabado no será suficiente para producir robots con capacidades amplias.

La prueba y error en el mundo real es lenta, costosa y capaz de dañar máquinas o lesionar personas. Veeda quiere trasladar gran parte de ese aprendizaje a entornos generados, que pueden ser replicados, acelerados y variados por software. Los fundadores describen el sistema pretendido como "the Matrix" para la IA física, aunque la primera tarea de Veeda es el trabajo menos cinematográfico de hacer que las escenas generadas sean lo suficientemente consistentes para que los robots aprendan comportamientos útiles a partir de ellas.

La operación de contratación de la compañía muestra la escala de esa tarea. Veeda está reclutando investigadores e ingenieros para generación multimodal abarcando imágenes, video y 3D, junto con entrenamiento distribuido, curación de datos e infraestructura de machine learning. Las ubicaciones listadas son Toronto, Zurich, Mountain View y Singapore.

Esos roles apuntan a una empresa de modelos intensiva en cómputo y datos más que a un fabricante de hardware robótico. Veeda está orientando su trabajo a la capa de simulación debajo de las políticas de los robots: los mundos generados, las observaciones de los sensores y las experiencias interactivas usadas para entrenar y evaluar máquinas antes del despliegue.

Competir con el laboratorio que ayudaron a construir

Veeda entra en un campo donde NVIDIA ya está impulsando una pila de modelos abierta. NVIDIA Cosmos combina generación del mundo, razonamiento físico y modelado de acciones para robots, vehículos autónomos y otros sistemas de IA física. Su familia más reciente, Cosmos 3, está diseñada para procesar y generar combinaciones de lenguaje, imágenes, video, audio y acciones.

El movimiento de Fidler pone a Veeda cerca del territorio técnico que ella ayudó a establecer dentro de NVIDIA. Ling fue un contribuidor clave en Cosmos, mientras que el trabajo de Gojcic en NVIDIA se centró en construir y simular entornos 3D. Veeda ahora está convirtiendo esa línea de investigación en una empresa independiente cuyo valor dependerá de si sus modelos pueden mejorar el entrenamiento de robots más allá de los simuladores convencionales, las demostraciones grabadas y las cadenas de video sintético.

Esa es la prueba técnica central. Un entorno generado puede parecer convincente mientras produce física incorrecta, objetos inconsistentes o consecuencias poco realistas por las acciones de un agente. Los desarrolladores de robótica necesitan simulaciones que se mantengan coherentes durante la interacción y que se traduzcan en ganancias medibles en máquinas reales.

Veeda apuesta a que los modelos interactivos del mundo se convertirán en el mecanismo de escalado que el texto en internet proporcionó para los modelos de lenguaje. Fidler ha dejado uno de los programas de IA física mejor financiados para perseguir esa apuesta con dos investigadores que la ayudaron a construir.

Reader comments

Conversation for this story loads after sign-in.