Nvidia、シングルGPU対応のAIエージェント向けにNemotron 3.5 Lightningを出荷
300億パラメータのオープンウェイトモデルは30億パラメータを有効化し、NvidiaのOpenMDWライセンスの下で商用利用を許可します。
By Ryan Merket · Published
Primary source: CNBC
Why it matters
Nemotron 3.5 Lightning gives startups a commercially usable agent model that can run on one GPU, while advancing Nvidia's strategy of turning free model access into hardware demand.

Nvidia released Nemotron 3.5 Lightning が8月11日に公開され、開発者に単一のNvidia GPU上でエージェントワークロードを実行するよう設計されたオープンウェイトの推論モデルを提供した。
このリリースは、CEOのJensen Huangによる公開キャンペーンに続くもので、彼は7月下旬にワシントンでのオープンAIモデルを巡る論争に参入していた。Huangには、開発者がダウンロードして自分で運用できるモデルを擁護する直接的な商業的理由がある:ローカルに展開されるすべてのモデルは計算資源を必要とし、Nvidiaはそれを提供するハードウェアとソフトウェアを販売しているからだ。
Nemotron 3.5 Lightningはその計算に基づいて構築されている。Nvidiaの公式モデルカードによると、総パラメータは300億で、各トークンごとに30億が活性化される。スパースな設計は、同じ総規模の密なモデルと比べて推論時に必要な計算量を削減する。
Nvidiaはサポートされるデプロイ構成として単一のDGX SparkシステムまたはH100 GPUを挙げている。モデルカードはまたGeForce RTX 5090、H200、GB200を名指しし、Ampere世代のGPUに対してはW4A16カーネルでのサポートを記している。これにより、マルチGPUサーバーを組み上げることなく自前のハードウェアでエージェントモデルを運用したいスタートアップにもNemotron 3.5 Lightningが手の届く存在になる。
Nvidia built for inference efficiency
Nemotron 3.5 LightningはMamba-2層、mixture-of-experts層、選択的アテンション層を組み合わせたハイブリッドアーキテクチャを使用している。コンテキストウィンドウは最大100万トークンまでサポートするが、本番環境でその限界に到達できるかは利用可能なメモリ、同時実行性、およびサービス構成に依存する。
公開されたチェックポイントは、推論のメモリおよび計算コストを削減するNvidiaの低精度フォーマットであるNVFP4を使用している。Nvidiaはまた同時に複数の候補トークンを生成するための3つのアプローチも提供している:Multi-Token Prediction、DFlash、そしてDGX Sparkや低同時実行のデータセンター向けに最適化された別のDSparkドラフトモデルだ。
これらのデプロイ詳細は見出しのパラメータ数よりも重要だ。エージェントシステムは計画、ツール選択、中間作業のために繰り返しモデル呼び出しを行う可能性がある。活性化パラメータが少なく、トークン生成が速いほど、これらのループのコストは削減される。特にモデルがより大きなフロンティアモデルの下でワーカーとして機能する場合に有利だ。
Nvidiaはこのモデルが20兆トークン以上で事前学習され、その後コード、数学、科学、ツールコール、構造化出力、長文検索のためにチューニングされたと述べている。事前学習データのカットオフは2025年9月で、ポストトレーニングのデータは2026年5月まで含まれる。
NvidiaはNVFP4チェックポイントについてSWE-bench Verifiedで52.8、ツールなしのGPQA Diamondで75.57のスコアを報告した。これらは独立した結果ではなくNvidia自身の測定値だ。Nvidiaはプロンプト、コンテナ、サービング設定を含む評価レシピをNeMo Gym経由で公開しており、開発者はスコアの再現を試みることができる。Nvidiaは主要なベンチマーク表で、現行のLlama、Qwen、DeepSeekモデルとの直接比較結果は公表していない。
Open weights feed Nvidia's hardware business
Nemotron 3.5 LightningはOpenMDW 1.1 licenseの下で商用利用可能だ。このライセンスはユーザーがNvidiaに支払うことなくモデル素材を扱うことを許可し、出力の変更や共有に制限を課さない。配布者はライセンスおよび該当する通知を保持しなければならない。特定の特許や著作権に関する訴訟をユーザーが開始した場合、付与は終了する可能性もある。
そのため、一部の報道で用いられる広義の「オープンソース」という表現よりも「オープンウェイト」がより正確な表記と言える。Nvidiaはダウンロード可能なウェイト、デプロイ用コード、評価レシピを提供しており、モデルカードは非公開のデータセットや、サイズが開示されていない複数のトレーニングデータカテゴリも明記している。
Huangは政策的な主張を7月24日のペーパーで展開し、ダウンロード可能なモデルは企業にデプロイのコントロールを与え、単一のAPIプロバイダーへの依存を軽減すると主張した。また、オープンモデル開発を米国外へ押し出しかねない制限を政策立案者に避けるよう促した。
商業的な主張はより単純だ。独自のAIベンダーは開発者がモデルを呼び出すと収益を得る。Nvidiaは開発者がどのモデルを選んでも、コンピュート層から収益を得ることができる。無料のウェイトは推論を正当化できるアプリケーションの数を拡大し、NVFP4、TensorRT-LLM、Nvidia固有のハードウェア向け最適化はその活動をNvidiaのスタックに近づける。
ビルダーにとって、Nemotron 3.5 Lightningはコーディングエージェント、検索システム、ツール使用アプリケーションのための別のデプロイ可能な基盤を提供する。競争力の評価は実際のワークロード下での独立したテストに依存するだろう。Nvidiaは既に意図する役割を明示している:オープンウェイトの採用をGPU需要の増加につなげる、迅速で商用利用可能なワーカーモデルである。