Nvidia lanza Nemotron 3.5 Lightning para agentes de IA que funcionan en una sola GPU

El modelo de pesos abiertos de 30 mil millones de parámetros activa 3 mil millones de parámetros y permite el uso comercial bajo la licencia OpenMDW de Nvidia.

By · Published

Primary source: CNBC

Why it matters

Nemotron 3.5 Lightning gives startups a commercially usable agent model that can run on one GPU, while advancing Nvidia's strategy of turning free model access into hardware demand.

Illustration of interconnected schematic modules labeled Nvidia Nemotron 3.5 Lightning, showing modular components, connections, and technical annotations for single-GPU AI agents.

Nvidia lanzó Nemotron 3.5 Lightning el 11 de agosto, ofreciendo a los desarrolladores un modelo de razonamiento de pesos abiertos diseñado para ejecutar cargas de trabajo de agentes en una sola GPU de Nvidia.

El lanzamiento sigue a una campaña pública del CEO Jensen Huang, quien entró en la disputa de Washington sobre modelos de IA abiertos a finales de julio. Huang tiene una razón comercial directa para defender modelos que los desarrolladores pueden descargar y operar por sí mismos: todo modelo desplegado localmente sigue necesitando cómputo, y Nvidia vende el hardware y el software usados para proporcionarlo.

Nemotron 3.5 Lightning se construye alrededor de ese cálculo. Según la ficha técnica oficial del modelo, contiene 30 mil millones de parámetros mientras activa 3 mil millones por cada token. El diseño esparso reduce la cantidad de cómputo requerida durante la inferencia en comparación con un modelo denso del mismo tamaño total.

Nvidia enumera un único sistema DGX Spark o una GPU H100 como configuraciones de despliegue compatibles. La ficha del modelo también nombra la GeForce RTX 5090, H200 y GB200, con soporte para GPUs de la generación Ampere mediante kernels W4A16. Eso pone a Nemotron 3.5 Lightning al alcance de startups que desean operar un modelo agente en su propio hardware sin ensamblar un servidor multi-GPU.

Nvidia optimizó para eficiencia en inferencia

Nemotron 3.5 Lightning usa una arquitectura híbrida que combina capas Mamba-2, capas de mezcla de expertos y capas de atención seleccionadas. Soporta ventanas de contexto de hasta 1 millón de tokens, aunque alcanzar ese límite en un despliegue de producción dependerá de la memoria disponible, la concurrencia y la configuración de servicio.

El checkpoint publicado usa NVFP4, el formato de baja precisión de Nvidia para reducir los costos de memoria y cómputo de la inferencia. Nvidia también envió tres enfoques para generar múltiples tokens candidatos a la vez: Multi-Token Prediction, DFlash y un modelo borrador separado DSpark optimizado para DGX Spark y cargas de trabajo de centros de datos con baja concurrencia.

Esos detalles de despliegue importan más que el recuento de parámetros en el titular. Los sistemas de agentes pueden hacer llamadas repetidas al modelo para planificación, selección de herramientas y trabajo intermedio. Un número menor de parámetros activos y una generación de tokens más rápida pueden reducir el costo de esos bucles, particularmente cuando el modelo sirve como trabajador bajo un modelo de vanguardia más grande.

Nvidia dice que el modelo fue preentrenado con más de 20 billones de tokens y luego ajustado para código, matemáticas, ciencia, llamadas a herramientas, salida estructurada y recuperación de documentos largos. Su corte de datos de preentrenamiento fue septiembre de 2025, mientras que los datos posteriores al entrenamiento se extendieron hasta mayo de 2026.

Nvidia reportó una puntuación de 52.8 en SWE-bench Verified para el checkpoint NVFP4 y 75.57 en GPQA Diamond sin herramientas. Esas son mediciones de Nvidia y no resultados independientes. Nvidia publicó sus recetas de evaluación a través de NeMo Gym, incluyendo prompts, contenedores y ajustes de servicio, para que los desarrolladores puedan intentar reproducir las puntuaciones. Nvidia no publicó resultados cara a cara contra los modelos actuales Llama, Qwen o DeepSeek en la tabla principal del benchmark.

Los pesos abiertos alimentan el negocio de hardware de Nvidia

Nemotron 3.5 Lightning está disponible para uso comercial bajo la licencia OpenMDW 1.1. La licencia permite a los usuarios trabajar con los materiales del modelo sin pagar a Nvidia y no impone restricciones sobre modificar o compartir las salidas. Los distribuidores deben conservar la licencia y los avisos aplicables. La concesión también puede terminar si un usuario inicia cierto tipo de litigio por patentes o derechos de autor relacionado con los materiales del modelo.

Eso convierte a "pesos abiertos" en la etiqueta más precisa que la descripción más amplia de código abierto utilizada en algunas coberturas. Nvidia proporciona pesos descargables, código de despliegue y recetas de evaluación, mientras que la ficha del modelo también identifica conjuntos de datos privados y múltiples categorías de datos de entrenamiento con tamaños no divulgados.

Huang expuso el caso de política en un documento del 24 de julio, argumentando que los modelos descargables dan a las empresas control sobre el despliegue y reducen la dependencia de un único proveedor de API. También instó a los responsables de políticas a evitar restricciones que puedan empujar el desarrollo de modelos abiertos fuera de Estados Unidos.

El caso comercial es más simple. Los proveedores de IA propietarios recaudan ingresos cuando los desarrolladores hacen llamadas a sus modelos. Nvidia puede ganar desde la capa de cómputo independientemente de qué modelo elija un desarrollador. Los pesos abiertos amplían el número de aplicaciones que pueden justificar ejecutar inferencia, mientras que la optimización para NVFP4, TensorRT-LLM y hardware específico de Nvidia mantiene esa actividad cerca de la pila de Nvidia.

Para los desarrolladores, Nemotron 3.5 Lightning ofrece otra base desplegable para codificar agentes, sistemas de recuperación y aplicaciones que usan herramientas. Su posición competitiva dependerá de pruebas independientes bajo cargas de trabajo reales. Nvidia ya ha dejado claro su papel previsto: un modelo trabajador rápido y utilizable comercialmente que convierte la adopción de pesos abiertos en una demanda adicional de GPUs.

Reader comments

Conversation for this story loads after sign-in.