NVIDIA lanza los pesos de Alpamayo 2 Super para desarrolladores de conducción autónoma

El modelo de 34 mil millones de parámetros combina un backbone de visión y lenguaje de 32B con un experto en acciones por difusión para robotaxis, camiones y flotas de entrega.

By · Published

Primary source: X

Why it matters

Alpamayo 2 Super extends NVIDIA from supplying AV compute into the models, simulation and developer tools that shape how autonomous-driving systems are trained and deployed.

NVIDIA releases Alpamayo 2 Super weights for autonomous-driving developers

NVIDIA CEO y cofundador Jensen Huang (@JensenHuang) publicó los pesos del modelo de Alpamayo 2 Super y el código de inferencia el 4 de agosto, dando a los desarrolladores de vehículos autónomos acceso a un sistema de 34 mil millones de parámetros diseñado para percibir escenas viales, explicar sus decisiones y generar trayectorias de conducción.

Huang describió Alpamayo 2 Super en una publicación en X como una columna vertebral de razonamiento para robotaxis, camiones, shuttles y camionetas de reparto. NVIDIA presentó el modelo en GTC Taipei el 31 de mayo, cuando dijo que los pesos y el código llegarían durante el verano. El lanzamiento del 4 de agosto convierte esa previa en un producto que los desarrolladores pueden descargar y probar.

Huang cofundó NVIDIA en 1993 después de desempeñar roles de ingeniería en AMD y LSI Logic. Su última expansión del negocio de autonomía de NVIDIA sigue la misma estrategia de plataforma que impulsó al fabricante de chips más allá de los procesadores gráficos y hacia el software, modelos y herramientas de desarrollo que corren en su hardware. Alpamayo coloca a NVIDIA aún más dentro de la capa de toma de decisiones de los vehículos autónomos, donde los fabricantes y operadores de robotaxis tradicionalmente han construido sistemas propietarios.

A large teacher model for driving systems

Alpamayo 2 Super combina una columna vertebral Cosmos 3 Super Reasoner de 32 mil millones de parámetros con un experto de acciones basado en difusión de 2.3 mil millones de parámetros. El modelo procesa video multi-cámara, instrucciones en texto y el historial de movimiento reciente de un vehículo. Devuelve trayectorias predichas junto con salidas de texto que pueden incluir rastros de razonamiento causal, respuestas visuales y decisiones de conducción de alto nivel como ceder el paso, cambiar de carril o detenerse.

Las configuraciones del cuaderno público usan seis cámaras y cuatro fotogramas históricos de cada cámara. La tarjeta del modelo de NVIDIA dice que su interfaz de trayectorias genera 64 waypoints que cubren los próximos 6.4 segundos en intervalos de 0.1 segundos. La compañía probó el modelo en una sola GPU H100 con 80GB de memoria, donde la configuración medida consumió aproximadamente 69.5 GiB de memoria de GPU reservada. Ese requisito de cómputo hace que Alpamayo 2 Super sea principalmente un modelo de desarrollo y entrenamiento basado en la nube más que un software pensado para ejecutarse sin cambios dentro de un vehículo.

NVIDIA está posicionando el lanzamiento como un modelo maestro. Los desarrolladores pueden usar sus salidas para etiquetar datos de flota, evaluar modelos de conducción más pequeños o destilar su razonamiento en sistemas que se ajusten a los límites de latencia y cómputo de una computadora a bordo como DRIVE AGX Thor. El código de inferencia y las recetas de desarrollo relacionadas también cubren afinamiento, entrenamiento por refuerzo post-entrenamiento y cuantización.

Los pesos se distribuyen bajo la licencia OpenMDW 1.1, mientras que NVIDIA dice que el código fuente usa Apache 2.0. La página de producto de NVIDIA describe Alpamayo 2 Super como disponible para uso comercial, aunque desplegar un modelo dentro de un vehículo de producción aún requiere pruebas a nivel de sistema, validación de seguridad e integración con el resto de la pila de autonomía.

NVIDIA moves further up the autonomy stack

Alpamayo 2 Super da a NVIDIA una vía hacia programas de conducción autónoma sin operar su propia red de robotaxis. Waymo, Tesla, Aurora, Waabi y otros desarrolladores de autonomía han construido pilas integradas verticalmente alrededor de sus propios datos, modelos y programas de vehículos. NVIDIA está vendiendo la infraestructura común debajo de esos esfuerzos: cómputo acelerado, simulación, herramientas de entrenamiento, modelos abiertos y hardware para vehículos.

Esa estrategia reduce el costo inicial para fabricantes, proveedores y startups que no pueden justificar construir cada parte de un sistema de autonomía internamente. También le da a NVIDIA influencia sobre las interfaces que conectan datos de entrenamiento, simulación, modelos de razonamiento y despliegue a bordo.

El modelo soporta entrada de cámaras 360 grados y puede producir lo que NVIDIA llama trazas Chain-of-Causation, que conectan una condición observada en la vía con una acción propuesta. Esas explicaciones pueden ayudar a los ingenieros a inspeccionar fallas y a comparar una política desplegada más pequeña con el modelo maestro más grande. No establecen que el modelo sea lo suficientemente seguro para operar en la vía sin supervisión.

NVIDIA reportó varias evaluaciones en su comunicado técnico, incluyendo una puntuación de 79.2 en LingoQA y una puntuación de bucle cerrado de AlpaSim de 1.50 a través de 913 escenas reconstruidas. Los resultados provienen de las propias pruebas de NVIDIA y no proporcionan una comparación directa de intervenciones, colisiones o millas autónomas frente a sistemas de conducción comerciales.

La tarjeta del modelo dice que Alpamayo 2 Super fue entrenado con aproximadamente 115,000 horas de video de conducción multi-cámara y alrededor de 3.7 millones de trazas de razonamiento generadas. NVIDIA había dicho previamente que la plataforma Alpamayo en general se acercaba a 400,000 descargas, una cifra que combina lanzamientos a lo largo de la familia de productos y no muestra cuántos equipos han colocado un sistema derivado de Alpamayo en un vehículo.

El lanzamiento del 4 de agosto da a los desarrolladores material suficiente para probar la apuesta central de NVIDIA: que los equipos de conducción autónoma adoptarán una base de razonamiento compartida y reservarán su trabajo propietario para los datos de la flota, el posentrenamiento, los sistemas de seguridad y la integración del vehículo. Si ese enfoque se impone, NVIDIA proveerá mucho más que las GPU usadas para entrenar vehículos autónomos. Proveerá la arquitectura de modelo que ayuda a decidir cómo se mueven.

Reader comments

Conversation for this story loads after sign-in.