Nvidia(英伟达)开始出货 Nemotron 3.5 Lightning,面向单 GPU AI 代理
这个拥有300亿参数的开放权重模型激活30亿个参数,并在Nvidia的OpenMDW许可证下允许商业使用。
By Ryan Merket · Published
Primary source: CNBC
Why it matters
Nemotron 3.5 Lightning gives startups a commercially usable agent model that can run on one GPU, while advancing Nvidia's strategy of turning free model access into hardware demand.

Nvidia 发布了 Nemotron 3.5 Lightning 于 8 月 11 日发布,为开发者提供了一个开放权重的推理模型,旨在在单张 Nvidia GPU 上运行 agent 工作负载。
此发布紧随 CEO Jensen Huang (黄仁勋) 在 7 月下旬公开参与华盛顿关于开放 AI 模型之争的活动之后。Huang 有直接的商业动机去维护那些开发者可以下载并自行运行的模型:每一个本地部署的模型仍然需要计算资源,而 Nvidia 销售用于提供这些计算的硬件和软件。
Nemotron 3.5 Lightning 就是围绕这一计算逻辑构建的。根据 Nvidia 的官方模型卡,它包含 300 亿参数,但每个 token 激活 30 亿个参数。与相同总规模的密集模型相比,这种稀疏设计在推理期间减少了所需的计算量。
Nvidia 列出单个 DGX Spark 系统或 H100 GPU 作为受支持的部署配置。模型卡还列出了 GeForce RTX 5090、H200 和 GB200,并通过 W4A16 内核支持 Ampere 世代 GPU。这使得 Nemotron 3.5 Lightning 对于希望在自有硬件上运行 agent 模型而无需组装多 GPU 服务器的初创公司可及。
Nvidia 为推理效率而构建
Nemotron 3.5 Lightning 采用混合架构,结合了 Mamba-2 层、mixture-of-experts 层和选择性注意力层。它支持最多可达 100 万个 tokens 的上下文窗口,尽管在生产部署中是否能达到该上限将取决于可用内存、并发量和服务配置。
发布的检查点使用 NVFP4,Nvidia 的低精度格式,用于降低推理的内存和计算成本。Nvidia 还提供了三种一次生成多个候选 token 的方法:Multi-Token Prediction、DFlash 以及为 DGX Spark 和低并发数据中心工作负载优化的独立 DSpark draft 模型。
这些部署细节比头条参数数量更重要。agent 系统可能会为了规划、工具选择和中间工作而重复调用模型。更少的活跃参数和更快的 token 生成能够降低这些循环的成本,尤其是在模型作为更大型前沿模型下方的工作者时。
Nvidia 表示该模型在超过 20 万亿个 tokens 上进行了预训练,随后针对代码、数学、科学、工具调用、结构化输出和长文档检索进行了微调。其预训练数据截止到 2025 年 9 月,而训练后数据延伸至 2026 年 5 月。
Nvidia 报告称 NVFP4 检查点在 SWE-bench Verified 上得分 52.8,在无需工具的 GPQA Diamond 上得分 75.57。这些是 Nvidia 的测量结果,而非独立结果。Nvidia 通过 NeMo Gym 发布了其评估方案,包括提示、容器和服务设置,因此开发者可以尝试复现这些分数。Nvidia 并未在主基准表中公布与当前 Llama、Qwen 或 DeepSeek 模型的正面对比结果。
开放权重为 Nvidia 的硬件业务提供推动力
Nemotron 3.5 Lightning 在 OpenMDW 1.1 许可证 下可用于商业用途。该许可证允许用户在不向 Nvidia 支付的情况下使用模型材料,并且对修改或共享输出不设限制。分发者必须保留该许可证和适用的通知。如果用户对模型材料发起某些专利或版权诉讼,许可权授予也可能终止。
这使得“开放权重”(open weight)比某些报道中使用的宽泛“开源”(open source)描述更为精确。Nvidia 提供了可下载的权重、部署代码和评估方案,同时模型卡也标注了私有数据集和多个未披露规模的训练数据类别。
Huang 在一篇7 月 24 日的论文 中阐述了政策论点,认为可下载的模型让企业对部署拥有控制权,并减少对单一 API 提供方的依赖。他还敦促政策制定者避免可能将开放模型开发推动到美国之外的限制。
商业理由更为直接。专有 AI 供应商在开发者调用其模型时获取收入。无论开发者选择哪个模型,Nvidia 都能从计算层获利。免费权重扩大了能够证明运行推理合理性的应用数量,而对 NVFP4、TensorRT-LLM 和 Nvidia 专用硬件的优化则将这些活动维持在靠近 Nvidia 技术栈的范围内。
对于构建者而言,Nemotron 3.5 Lightning 提供了另一个可部署的基础,用于构建编码 agent、检索系统和使用工具的应用。其竞争地位将取决于在真实工作负载下的独立测试。Nvidia 已经明确了其意图角色:一个快速、可用于商业的工作者模型,将开放权重的采用转化为对 GPU 的额外需求。