Simple AI、ロボットアームを用いずに収集した2,000時間分のロボット学習データを公開
創業者のXiaofei Liは、自動運転向けのデータ活用手法をマニピュレーションに適用しており、限定的な同等性の主張は、人間のデモンストレーションを10倍以上用いて構築されている。
By RuntimeWire Staff · Published
Primary source: PR Newswire
Why it matters
Robot teleoperation makes manipulation data accurate and expensive. HiFi-UMI suggests portable human capture can substitute for it in some post-training pipelines, though Simple AI used more than 10 times as many demonstrations.

Xiaofei Li、Simple AI の創業者兼CEOは、ターゲットとなるロボットやロボットのテレオペレーションをデータ収集時に必要としない2,000時間のロボティクスデータセットを8月20日に公開した。HiFi-UMI system は、携帯可能なセンサー付きグリッパーを使って人が両手で操作するタスクを記録し、そのデモンストレーションを実際のロボットアームの訓練用軌道に変換する。
この公開は、Liが自動運転の経歴で学んだ教訓をロボティクス製品に転換したものである。Public investor material によれば、LiはTsinghua Universityで学士号と博士号を取得し、Simple AI を創業する前にL4自動運転アーキテクチャの開発に携わった。彼の現在の賭けは、自動運転車を形作ったデータループのアプローチに従うものである:実環境で行動を収集し、品質管理を自動化し、得られたデータをモデルに与え、モデルを物理世界で再試験する。
8月20日の発表 でLiは、データの忠実度がロボットを使わないデモンストレーションを展開指向の訓練に適するものにできるかどうかを判断したいと述べた。付随する技術報告(最初の投稿は7月28日)は、3つのポリシーアーキテクチャと4つの卓上タスク群にわたって従来のロボットテレオペレーションと概ね同等の性能を報告している。
A data factory without the robot arm
ロボットテレオペレーションは、記録された各動作がすでに特定の機械の幾何学、センサー、物理的制限を反映しているため、有用な訓練データを生み出す。また、収集の各時間がロボットアーム、制御リグ、オペレータに結び付くため、家庭、ホテル、倉庫など多様な環境にわたる拡張は遅く資本集約的になる。
2024年の論文でStanford University、Columbia University、Toyota Research Instituteに所属する研究者らが導入したロボット不要の人間デモンストレーションシステムであるUniversal Manipulation Interface は別の道を示した。そのハンドヘルドグリッパーにより、人はロボットをあらゆる場所へ運ばなくても自然な環境でタスクを示すことができる。Simple AIの研究は、軌道の精度、同期、カメラのカバレッジ、二つのグリッパー間の相対位置など、残る忠実度の問題に焦点を当てている。
HiFi-UMI はオペレータの頭部にステレオカメラと慣性センサーを、各手モジュールに非平行の魚眼カメラを二台配置する。Simple AI は局所的なエンドエフェクタ精度が約3ミリメートル、センサー同期が40マイクロ秒未満、各手の周囲の視野が約200度であると報告している。共有ハードウェアトリガーがカメラと慣性センサーを整合させる。
キャプチャ後、Simple AI は各軌道を再構築し、それをシミュレーションで再生しようと試みる。Simple AI はリリース資料 において、軌道再構築とシミュレーション再生検証のいずれも約98%の合格率を報告している。この自動化された棄却ステップは商業的に重要である。なぜなら、より安価な収集が、エンジニアが各エピソードを手動で修復または検査しなければならないなら多くの利点を失うからだ。
HiFi-UMI-2K データセットは、そのデータセットカード によれば、110以上のシーンにわたって収集された2,000時間・482,000以上のエピソードを含む。同期されたマルチビュー映像、両手の軌道、グリッパー状態、言語注釈、サブタスク境界、品質管理メタデータが含まれる。Simple AI はこれを CC BY 4.0 ライセンスで公開しており、帰属の条件で商用利用が許される。
HiFi-UMI-2K は、Simple AI が処理したと主張するより大きなコーパスの1/10未満を表す。プロジェクトの資料は、480以上のシーンにわたって20,000時間以上・432万以上のエピソードを収集したと主張している。2,000時間を公開することで、外部の研究者はモデルを訓練・評価するのに十分な素材を得られる一方で、報告されたコーパスの大部分は未公開のまま残る。
The parity claim has a denominator
報告書 は、vision-language-action と world-action-model のアプローチをまたがる3つのポリシーバックボーンを評価し、4つの両手を使う卓上タスクにわたって実験を行っている。ロボットテレオペレーションデータでの後学習を行ったポリシーと比較して、HiFi-UMIのみのポリシーは総合成功率でそれぞれ -2.5、+3.1、-0.6 パーセンテージポイントの差を示した。
精密挿入タスクでは、最も強いHiFi-UMIのみのポリシーが85%の成功率に達した。テレオペレーションのベースラインは評価シーンでデモンストレーションが収集されていたため明らかに環境上の利点があった一方、ロボット不要の例は別の場所から来ていた。
これらの結果は分母に注意を要する。vision-language-action の比較では、タスクごとに約3,200のHiFi-UMI軌道と約300のテレオペレーション軌道が使用された。したがって Simple AI はロボット不要のデモンストレーションを10倍以上使用している。関連する商業的テストは、追加されたこれらの人間デモンストレーションが十分に安く迅速に生成できるかどうかである。軌道あたりのデータ効率は未解決のままである。
評価に用いられたロボットは、キャプチャシステムのグリッパーと手首カメラの構成を共有していた。アームの運動学は異なっていたが、テストは極端に異なるハンド、センサー配置、ロボット本体を跨ぐものではなかった。著者らは結論をテストされたモデル、タスク、条件に限定している。HiFi-UMI は、このセットアップでは実ロボットでの事後学習というアンカーを取り除けるという証拠を提供するものであって、操作モデルがもはやロボット生成データを必要としないという一般的な発見を示すものではない。
事前学習の結果はLiのデータ運用の第二の用途を示唆している。Simple AI によれば、より広いコーパスからの4,000時間で1つのポリシーを事前学習させると、未見の10タスクにわたるオフライン行動予測誤差が平均で41%低減したという。評価された StarVLA-QwenPI セットアップでは、タスク固有の事後学習データ量を一定にした場合に実ロボットの成功率が18.1パーセンテージポイント上昇した。
Li is building the data loop before the household robot
Simple AI は北京に本拠を置いている。Li は、embodied AI を技術的デモンストレーションから再現可能な製品と展開へと移行する産業として位置づけており、この変化は彼が以前に自動運転で見てきたものだと述べている。
資本はその仮説に追随してきたが、公的な資金調達の記録は整合させるのが難しい。2026年4月の報告 は、Linear Capital と Puhua Capital が主導し、Junshan Capital、Shunwei Capital、BV Baidu Ventures が参加する別の数億元規模のラウンドを伝えた。別の6月の資金調達報告 は、Didi、Plum Ventures、Col Capital、Linear Capital、CCV、Puhua Capital 支援の数億元規模のPre-Aラウンドを伝えたが、入手可能な資料はリード投資家が誰であるかや両ラウンドの関係を確定していない。
HiFi-UMI の公開は、その資本の一部がどこに向かっているかを示している。Simple AI は、キャプチャハードウェア、再構築ソフトウェア、アノテーション、シミュレーション検証、モデル訓練、ロボット展開を単一の生産チェーンに組み立てつつある。
競争分野は既にロボット重視の収集とロボット不要の収集に分かれつつある。DROID dataset はロボットベースの収集とテレオペレーション機器を使用しており、Trillion Robotics のような商用サプライヤは携帯型の handheld UMI ハードウェアを販売している。Simple AI は、より厳密なセンシングと自動化された再生により、携帯可能なデモンストレーションが訓練の最終的なタスク固有段階に十分な精度を提供できると賭けている。
寛容なライセンスの下で2,000時間を公開することは配布戦略でもある。研究者がこのフォーマットを採用し、結果を再現し、HiFi-UMIを中心に訓練ツールを構築すれば、Simple AI の収集手法は自社のロボットを超えて信頼性を獲得するだろう。Simple AI が処理したと主張するより大きなコーパスは、出現しつつある公共標準の延長としてさらに価値を持つ可能性がある。
Liの即時的な業績は、家庭用ロボットが掲げる広範な約束よりも範囲が狭く、より有用である。Simple AIは大規模なデータ生成システムを構築し、制御された条件下でグリッパーを携えた人間がデータ収集中にロボットを操作することなく、ロボットを訓練するのに十分な高忠実度の監督を生成できることを示すベンチマークを公開した。その置き換えの経済性と、異なるハードウェアや接触の多いタスクに耐えられるかどうかが、HiFi-UMIがインフラになるのか、それとも別の強力なラボの成果にとどまるのかを左右するだろう。