NVIDIA、Alpamayo 2 Superの重みを自動運転開発者向けに公開
340億パラメータのモデルは、32Bのビジョン・ランゲージバックボーンと拡散アクションエキスパートを組み合わせ、ロボタクシー、トラック、配送フリート向けです。
By Ryan Merket · Published
Primary source: X
Why it matters
Alpamayo 2 Super extends NVIDIA from supplying AV compute into the models, simulation and developer tools that shape how autonomous-driving systems are trained and deployed.

NVIDIA CEOで共同設立者のJensen Huang (@JensenHuang)は8月4日にAlpamayo 2 Superのモデル重みと推論コードを公開し、自動運転車の開発者に道路シーンを知覚し、意思決定を説明し、走行軌跡を生成するための340億パラメータのシステムへのアクセスを提供した。
HuangはXへの投稿でAlpamayo 2 Superをロボタクシー、トラック、シャトル、配送バン向けの推論バックボーンと表現した。NVIDIAは5月31日のGTC Taipeiで同モデルを発表し、重みとコードは夏の間に公開されると述べていた。8月4日の公開により、その時点でのプレビューが開発者がダウンロードしてテストできる製品へと変わった。
HuangはAMDとLSI Logicでのエンジニア職を経て1993年にNVIDIAを共同設立した。NVIDIAの自律走行事業の最新の拡大は、同社をグラフィックスプロセッサの枠を超えてハードウェア上で動作するソフトウェア、モデル、開発者ツールへと押し進めたのと同じプラットフォーム戦略に沿ったものだ。Alpamayoは自動車メーカーやロボタクシー事業者が従来は独自に構築してきた自律走行車の意思決定層にNVIDIAをさらに深く位置づける。
A large teacher model for driving systems
Alpamayo 2 Superは32億パラメータのCosmos 3 Super Reasonerバックボーンと、23億パラメータの拡散ベースのアクションエキスパートを組み合わせている。モデルはマルチカメラ映像、テキスト指示、車両の直近の運動履歴を処理する。出力として予測軌跡とともに因果推論の痕跡、視覚的回答、高レベルの運転判断(譲る、車線変更、停止など)を含むテキスト出力を返すことができる。
公開されているノートブックの構成では6台のカメラと各カメラからの過去フレーム4枚を使用する。NVIDIAのモデルカードによれば、その軌跡インターフェースは0.1秒間隔で次の6.4秒をカバーする64のウェイポイントを生成する。同社は80GBメモリの単一H100 GPUでモデルをテストしており、測定された構成では予約済みGPUメモリを約69.5 GiB消費した。こうした計算要件から、Alpamayo 2 Superは主にクラウドベースでの開発・トレーニング向けモデルであり、車載機内で変更なくそのまま動作させることを意図したソフトウェアではない。
NVIDIAはこの公開をティーチャーモデルとして位置づけている。開発者はその出力を使ってフリートデータにラベル付けを行ったり、小型の運転モデルを評価したり、推論をDRIVE AGX Thorのような車載コンピュータのレイテンシーや計算制約に合わせたシステムへと蒸留したりできる。推論コードと関連する開発レシピはファインチューニング、強化学習の事後トレーニング、量子化もカバーしている。
重みはOpenMDW 1.1ライセンスの下で配布され、NVIDIAによればソースコードはApache 2.0を使用している。NVIDIAの製品ページはAlpamayo 2 Superを商用利用可能と説明しているが、製品車両内でモデルを展開するにはシステムレベルのテスト、安全性の検証、および自律スタックの残りの部分との統合が依然必要である。
NVIDIA moves further up the autonomy stack
Alpamayo 2 Superは、NVIDIAが独自のロボタクシーネットワークを運用せずとも自律走行プログラムに関与するルートを与える。Waymo、Tesla、Aurora、Waabiなどの自律開発者は自社のデータ、モデル、車両プログラムを中心に垂直統合されたスタックを構築してきた。NVIDIAはそれらの取り組みの下にある共通インフラストラクチャ――アクセラレーテッドコンピューティング、シミュレーション、トレーニングツール、オープンモデル、車載ハードウェア――を販売している。
この戦略は、自律システムの全ての部分を社内で構築することを正当化できない自動車メーカー、サプライヤー、スタートアップにとって初期コストを下げる。また、トレーニングデータ、シミュレーション、推論モデル、車載展開をつなぐインターフェースに対するNVIDIAの影響力も高める。
モデルは360度カメラ入力をサポートし、観測された道路状況と提案された行動を結び付けるNVIDIAがChain-of-Causationと呼ぶトレースを生成できる。これらの説明はエンジニアが失敗を検査したり、小型の展開済みポリシーを大規模なティーチャーモデルと比較したりするのに役立つ可能性がある。しかし、それらがモデルを無監視の道路運用に十分安全であると立証するものではない。
NVIDIAはテクニカルリリースでいくつかの評価を報告しており、その中にはLingoQAでの79.2というスコアと、913の再構成シーンにわたるAlpaSimのクローズドループスコア1.50が含まれる。これらの結果はNVIDIA自身のテストに基づくものであり、市販の運転システムに対するドライバー介入(disengagements)、衝突、あるいは自律走行マイルの直接比較を提供するものではない。
モデルカードによれば、Alpamayo 2 Superは約115,000時間のマルチカメラ走行映像と約370万件の生成された推論トレースで訓練された。NVIDIAは以前、より広いAlpamayoプラットフォームが約400,000ダウンロードに達したと述べていたが、この数値は製品ファミリー全体のリリースを合算したもので、Alpamayo派生システムを実際に車両に搭載したチームの数を示すものではない。
8月4日の公開は、開発者にNVIDIAの中核的な賭けを試すための十分な素材を提供する:自律走行チームが共有された推論基盤を採用し、独自の作業はフリートデータ、事後トレーニング、安全システム、車両統合に留める、という考えだ。そのアプローチが定着すれば、NVIDIAは自律車の訓練に使われるGPU以上のものを供給することになる。移動の決定を助けるモデルアーキテクチャそのものを提供することになる。