Simple AI 发布了 2,000 小时的机器人训练数据,这些数据是在没有机器人手臂的情况下收集的
创始人 Xiaofei Li 正在将自动驾驶的数据策略手册应用于操控领域,其有限的同等性主张基于超过 10 倍数量的人类示范。
By RuntimeWire Staff · Published
Primary source: PR Newswire
Why it matters
Robot teleoperation makes manipulation data accurate and expensive. HiFi-UMI suggests portable human capture can substitute for it in some post-training pipelines, though Simple AI used more than 10 times as many demonstrations.

Xiaofei Li, founder and CEO of Simple AI, 于 8 月 20 日发布了一个 2,000 小时的机器人数据集,该数据集在数据采集阶段消除了对目标机器人或机器人远程操控的需求。HiFi-UMI system 记录人们使用配备传感器的便携夹爪执行双手操作任务,然后将这些示范转换为用于训练真实机器人臂的轨迹。
此次发布将 Li 在自动驾驶生涯中学到的一课转化为机器人产品。Public investor material 表示 Li 在 Tsinghua University 获得学士和博士学位,并在创建 Simple AI 之前参与开发过 L4 级别的自动驾驶架构。他目前的赌注沿用了塑造自动驾驶的“数据回路”方法:在真实环境中收集行为,自动化质量控制,将生成的数据馈入模型,并在物理世界中回测这些模型。
在 an August 20 announcement 中,Li 表示 Simple AI 想要确定数据保真度是否能使无机器人示范适用于面向部署的训练。随附的 technical report,首次发表于 7 月 28 日,报告在三种策略架构和四组桌面任务上与传统机器人远程操控的近似性能持平。
一个没有机械臂的数据工厂
机器人远程操控能够产生有用的训练数据,因为每个记录的动作已经反映了特定机器的几何形状、传感器和物理限制。但它也将每小时的采集绑定到一台机器人、一套控制装置和一名操作者上。这使得在家庭、酒店、仓库和其他多样化环境中的扩展既缓慢又资本密集。
Universal Manipulation Interface 是一套由斯坦福大学、哥伦比亚大学和 Toyota Research Institute 相关研究者在 2024 年论文中提出的无机器人人类示范系统,为另一条路线提供了可能。其手持夹爪让人们在自然场景中演示任务,而无需把机器人搬到每个地点。Simple AI 的研究集中于剩余的保真度问题,包括轨迹精确性、同步、相机覆盖以及两只夹爪之间的相对位置。
HiFi-UMI 在操作者头部放置了一台立体相机和惯性传感器,并在每个手部模块上放置了两个非平行的鱼眼相机。Simple AI 报告局部末端执行器精度约为 3 毫米,传感器同步低于 40 微秒,以及每只手约 200 度的视觉覆盖。一个共享的硬件触发器对齐了摄像头和惯性传感器。
采集后,Simple AI 重建每条轨迹并尝试在仿真中重放。Simple AI 在其 release materials 中报告轨迹重建和仿真重放验证的通过率均约为 98%。这一自动化的拒绝步骤在商业上很重要,因为如果工程师必须人工修复或检查每个采集片段,那么更便宜的采集方式就会失去大部分优势。
据其 dataset card 显示,HiFi-UMI-2K 数据集包含 2,000 小时和超过 482,000 个采集片段,覆盖 110 多个场景。它包括同步的多视角视频、双手轨迹、夹爪状态、语言注释、子任务边界以及质量控制元数据。Simple AI 在 CC BY 4.0 许可下发布该数据集,允许在署名的前提下进行商业使用。
HiFi-UMI-2K 只是 Simple AI 声称已处理的大型语料库的不到十分之一。项目材料称他们已在 480 多个场景中收集了超过 20,000 小时和 432 万个采集片段。开放 2,000 小时为外部研究者提供了足够的材料来训练和测试模型,同时将报告的语料的大部分保留未公开。
平价主张有一个分母
该 report 在四个双手桌面任务上评估了三种策略骨干,涵盖视觉-语言-动作和世界-动作-模型方法。与在机器人远程操控数据上后训练的策略相比,仅使用 HiFi-UMI 的策略在总体成功率上的差异分别为 -2.5、+3.1 和 -0.6 个百分点。
在一项精密插入任务上,表现最好的仅 HiFi-UMI 策略达到了 85% 的成功率。远程操控基线显然具有环境优势,因为它的示范是在评估场景中采集的,而无机器人示范来自其他位置。
这些结果需要一个谨慎的分母来解读。视觉-语言-动作的比较中,每个任务使用了约 3,200 条 HiFi-UMI 轨迹和大约 300 条远程操控轨迹。因此 Simple AI 使用了超过 10 倍的无机器人示范。相关的商业问题是,这些额外的人类示范是否足够便宜且更快地生成。按轨迹计算的数据效率仍未解决。
用于评估的机器人也共享了采集系统的夹爪和腕部相机配置。其臂运动学有所不同,但测试并未覆盖截然不同的手、传感器布局或机器人平台。作者将结论限于所测试的模型、任务和条件。HiFi-UMI 提供的证据是,在该设置下可以去除真实机器人后训练的锚定步骤,而不是普遍证明操纵模型不再需要机器人生成的数据。
预训练结果指向了 Li 数据操作的第二种用途。Simple AI 表示,在更大语料中使用 4,000 小时进行预训练的单一策略,在 10 个未见任务上的平均离线动作预测误差降低了 41%。在评估的 StarVLA-QwenPI 设置上,当任务特定的后训练数据量保持不变时,预训练使实机成功率提高了 18.1 个百分点。
Li 在家用机器人之前建立数据循环
Simple AI 总部位于北京。Li 将具身 AI 描述为一个从技术演示走向可重复产品和部署的行业转型,他在自动驾驶领域曾见证过这一转变。
资本也随之而来,尽管公开的融资记录难以理清。An April 2026 report 描述了一轮由 Linear Capital 和 Puhua Capital 领投、Junshan Capital、Shunwei Capital 和 BV Baidu Ventures 参与的数亿元人民币融资。Separate June financing reports 则描述了一轮由 Didi、Plum Ventures、Col Capital、Linear Capital、CCV 和 Puhua Capital 支持的 Pre-A 轮数亿元人民币融资,但现有材料并未确定领投方或两轮融资间的关系。
HiFi-UMI 的发布展示了部分资金的去向。Simple AI 正在将采集硬件、重建软件、注释、仿真验证、模型训练和机器人部署组装成一条完整的生产链。
竞争领域已经在以机器人为主的采集与无机器人采集之间分化。DROID dataset 使用基于机器人的采集和远程操控设备,而商业供应商如 Trillion Robotics 则在销售便携式手持 UMI 硬件。Simple AI 的押注是,更紧密的传感和自动化重放可以使便携示范在训练的最终任务特定阶段足够精确。
在宽松许可下发布 2,000 小时数据也是一种分发举措。如果研究人员采用该格式、重现结果或围绕 HiFi-UMI 构建训练工具,Simple AI 的采集方法将获得超出其自有机器人范围的可信度。Simple AI 称其已处理的更大语料随后可能作为新兴公共标准的延伸而变得更有价值。
Li 的近期成就比家庭机器人的广泛承诺更具体也更有用。Simple AI 已经建立了一个规模可观的数据生产系统,并发布了一个基准测试,表明在受控条件下,携带夹爪的人可以产生足够的高保真监督来训练机器人,而在数据收集期间无需实际操作机器人。该替代方案的经济性,以及它在不同硬件和接触密集任务下生存的能力,将决定 HiFi-UMI 是成为基础设施还是又一个强有力的实验室成果。