NVIDIAの研究ベテランSanja Fidler、ロボットのワールドモデル向けにVeeda AIを立ち上げる

元NVIDIAのAI研究担当副社長は、Zan GojcicとHuan Lingとともに、身体性を持つエージェント向けのシミュレーション環境を中心にVeedaを構築している。

By · Published

Primary source: X

Why it matters

A team that helped shape NVIDIA's world-model research is now trying to own the model layer independently, betting simulated interaction will supply the training scale that robotics still lacks.

NVIDIA research veteran Sanja Fidler launches Veeda AI for robot world models — The former NVIDIA AI research vice president is building Veeda with Zan Gojcic and Huan Ling around simulated environments for embodied agents.

Sanja Fidler (@FidlerSanja) は水曜日に、長年の協働者である Zan Gojcic (@ZGojcic)Huan Ling (@HuanLing6) とともに Veeda AI を立ち上げ、生成された物理環境内でロボットを訓練できるワールドモデルを構築する新しいAIラボを設立した。

Fidler は Xへの投稿でVeeda AIを紹介した のが8月19日だ。今回の立ち上げは、彼女がNVIDIAで8年間にわたって発展させたワールドモデルの仮説に、会社名と商業的な拠点を与えるものだ:ロボットは、ポリシーがハードウェアに展開される前に繰り返し行動し、失敗し、適応できる現実的でインタラクティブなシミュレーションを必要とするだろう。

From NVIDIA research to a startup

Fidler は7月31日にNVIDIAを離れると発表した。同社ではトロントのAI研究部門を率い、AI研究担当副社長にまで昇進していた。彼女は現在も University of Toronto の准教授であり、Vector Institute の共同設立メンバーでもある。彼女の研究はコンピュータビジョン、3Dシーン理解、シミュレーション、マルチモーダルモデルを中心に行われていると、University of Toronto のプロフィール によれば。

Veeda の他の創業者たちは、その研究を再構成、生成モデル、そしてそれらを訓練するために必要なデータシステムに広げている。Gojcic はチューリッヒのNVIDIA研究でニューラル再構成と物理AI向けの生成ワールドシミュレーションを率いた。彼は ETH Zurich で3Dコンピュータビジョンの博士号を取得し、以前は Stanford で客員研究者として働いていた。

Ling は Fidler の指導のもと University of Toronto で博士号を取得し、その後 NVIDIA のリサーチマネージャーになった。彼のチームは生成ワールドモデルや高忠実度の基盤モデルに取り組み、物理環境をシミュレートするモデルの構築と適応のためのチップメーカーのプラットフォームである NVIDIA Cosmos にも貢献している。

3人の創業者はすでに何年も一緒に論文を発表し、研究を進めてきた。その共通の歴史により、Veeda は現在のロボティクス資金サイクルに合わせて組成された創業チームというよりも、ビデオ生成、3D再構成、シミュレーション、訓練インフラにまたがる技術的基盤を持つ。

The world-model bet

Veeda は物理的現実をシミュレートするマルチモーダルな基盤ワールドモデルを開発しており、体現されたAIエージェントが相互作用を通じて学習できる環境を作ることを目標にしている。彼らの公開された主張は明快だ:記録された人間の行動からの模倣学習だけでは、広く能力を持つロボットを生み出すには不十分だ。

現実世界での試行錯誤は遅く高価であり、機械を壊したり人を負傷させたりする可能性がある。Veeda はその学習の多くをソフトウェアで複製、加速、変化させうる生成環境へ移したいと考えている。創業者たちは意図するシステムを物理AIの「the Matrix」と表現しているが、Veeda の最初の課題は生成されたシーンをロボットがそこから有用な行動を学べるほど一貫性のあるものにする、より劇的でない作業だ。

同社の 採用活動 はその作業規模を示している。Veeda は画像、ビデオ、3D にまたがるマルチモーダル生成の研究者やエンジニア、分散トレーニング、データキュレーション、機械学習インフラの人員を募集している。記載されている勤務地はトロント、チューリッヒ、マウンテンビュー、シンガポールだ。

これらの職種はロボティクスのハードウェア製造者というよりも、計算資源とデータを重視するモデリング企業を指している。Veeda が狙うのはロボットのポリシーの下にあるシミュレーション層だ:生成された世界、センサー観測、そしてマシンの展開前に訓練と評価に使われるインタラクティブな体験である。

Competing with the lab they helped build

Veeda が参入する分野では NVIDIA がすでにオープンなモデルスタックを推進している。NVIDIA Cosmos はロボット、自動運転車、その他の物理的AIシステム向けにワールド生成、物理的推論、行動モデリングを組み合わせている。その最新のファミリーである Cosmos 3 は、言語、画像、ビデオ、オーディオ、行動の組み合わせを処理・生成するよう設計されている。

Fidler の移籍は、彼女がNVIDIA内部で確立するのを助けた技術領域に Veeda を近づけるものだ。Ling は Cosmos に対する主要な貢献者であり、Gojcic のNVIDIAでの仕事は3D環境の構築とシミュレーションに焦点を当てていた。Veeda は今、その研究の系譜を独立した企業へと変えようとしており、その価値は同社のモデルが従来のシミュレータ、記録されたデモンストレーション、合成ビデオのパイプラインを超えてロボット訓練を改善できるかにかかっている。

それが中心的な技術的検証だ。生成された環境は説得力があるように見えても、誤った物理法則を生じさせたり、オブジェクトが一貫性を欠いたり、エージェントの行動に対して非現実的な結果をもたらしたりする可能性がある。ロボティクス開発者は、相互作用を通じて一貫性を保ち、実機での測定可能な向上へと移転するシミュレーションを必要としている。

Veeda は、インタラクティブなワールドモデルが言語モデルに対してインターネット上のテキストが提供したスケーリングの仕組みになると見て賭けをしている。Fidler は、彼女がそれを構築するのを手伝った2人の研究者とともに、その賭けを追求するために最も資金の潤沢な物理AIプログラムの一つを離れた。

Reader comments

Conversation for this story loads after sign-in.