Dyna Robotics 使用超过 100 万小时的人类视频训练 DYNA-2

Caper AI 背后的创始人和一位前 DeepMind 研究员押注,由人类拍摄的视频可以减少机器人完成新任务所需的数据,不过这些结果仍由 Dyna Robotics 报道。

By · Published

Primary source: PR Newswire

Why it matters

Dyna Robotics is trying to reduce reliance on costly task-specific robot demonstrations by pretraining on abundant human video. If Dyna Robotics' reported results hold up under independent testing, robotics teams could adapt machines to new work with less local data.

Illustration of Dyna Robotics' DYNA-2 robotic arm performing a complex human task with a nearby monitor showing simplified human motion.

Dyna Robotics founders Lindon Gao, York Yang and Jason Ma 推出 DYNA-2 on August 10, 2026, 推出一个在超过 100 万小时第一视角人类视频上训练的机器人基础模型。

三位创始人来自物理 AI 的不同方向。Gao 和 Yang 之前创建了 Caper AI,该公司将摄像头、传感器和结账软件集成到购物车中。Instacart 于 2021 年 10 月以 3.5 亿美元收购了 Caper AI。Ma 在 University of Pennsylvania's GRASP robotics lab 完成了博士学位,并在 Google DeepMind、NVIDIA AI 和 Meta AI 的研究岗位之后,从事机器人基础模型和强化学习的研究

这种组合解释了 Dyna Robotics 的方法:围绕可扩展的数据构建研究模型,同时在平凡的商业工作上进行测试,以便可以衡量失败。Dyna Robotics 表示,其早期模型 DYNA-1 驱动的系统已在酒店、餐馆和洗衣店中运行。

“基于视频训练” 的含义

Dyna Robotics 将 DYNA-2 称为 World-Action Model,或 WAM。Dyna Robotics 的公告 描述了一个基于视频的系统,该系统预测未来帧和机器人动作,人类视频提供了预训练信号。

Ma 在公告中总结了这一论点:“动作数据稀缺,但视频无处不在。”

Dyna Robotics 表示 DYNA-2 在预训练阶段使用了超过 100 万小时的第一视角人类视频,并且在预训练期间没有见到机器人帧。Dyna Robotics 还报告称随着人类视频预训练量的增加,在 15 项基准任务上有所改进

Dyna Robotics 表示其结果显示了人类到机器人的规模关系。

从规模化主张到物理任务

Dyna Robotics 报告称,在预训练增加时,高精度制造任务的成功率从 20% 提高到 80%-90%,而后训练数据没有变化。这些是 Dyna Robotics 的内部结果。

在匹配的真实世界评估中,Dyna Robotics 报告称 DYNA-2 完成任务的频率是 DYNA-1 的 1.55 倍,DYNA-1 是 Dyna Robotics 早期的视觉-语言-动作模型。在一次客户部署中,Dyna Robotics 报告称 DYNA-2 的通过率为 87%,而 DYNA-1 为 46%。

Dyna Robotics 的部署数据提供了更直接的商业检验,但这些数据仍为内部报告。机器人可能完成了评估,但对付费工作来说仍然过慢、不稳定或成本过高。需要独立测试和更完整的部署数据来评估这些通过率如何在不同客户和硬件之间转化。

一个由 1.435 亿美元支持的二次创业者押注

DYNA-2 在 Dyna Robotics 于 2024 年成立约两年后推出。Gao 进入机器人领域的路径经过金融和多次针对实体零售技术的尝试。Stuyvesant Alumni Association 的简介 称他在 NYU Stern 学习商业,曾在 Goldman Sachs 从事投资银行工作,并创建了 QueueHop——一家防盗服饰标签业务,被 Y Combinator 的 2016 年冬季项目录取,之后才开发 Caper AI。

Yang 曾担任 Caper AI 的首席技术官,后来在 Instacart 担任首席研究工程师。Ma 作为前 DeepMind 研究科学家,专注于机器人基础模型,为团队带来了经验。DYNA-2 将这些创始人在零售硬件和机器人领域的背景转化为 Dyna Robotics 的核心产品策略。

投资者为这一努力提供了大量资金。Dyna Robotics 在 2025 年 3 月筹集了由 CRVFirst Round Capital 共同领投的 2350 万美元种子轮。随后在 2025 年完成了一轮 1.2 亿美元的 A 轮融资,由 RoboStrategy、CRV 和 First Round Capital 领投。Salesforce Ventures 也表示参与了此次融资。

这使 Dyna Robotics 至少获得了 1.435 亿美元的已披露融资。资金用于购买计算资源、数据运营、硬件工作和现场部署,以测试 DYNA-2 的性能在超过 100 万小时后能否继续提升。

竞争对手也在开发旨在跨任务或跨机器工作的模型。Physical Intelligence 将 openpi 描述为 一个开源的机器人模型和软件包集合,其中包括 pi0,一种视觉-语言-动作模型。Skild AI 将其 Skild Brain 描述为 为控制不同机器人类型和任务而设计的共享智能。Google DeepMind 表示 Gemini Robotics On-Device 针对本地、低延迟推理进行了优化,并且可以通过微调适应新任务。Dyna Robotics 做出了一个更具体的赌注:人类活动视频可以成为对灵巧操作产生复利效果的输入,从而减少对机器人远程操作数据的依赖。

客户经济性将决定该技术优势能否持续。Dyna Robotics 的客户现场通过率对比是令人鼓舞的内部证据。车队规模、部署时间、维护负担以及为每个新工作流程所需的工程量,将决定 DYNA-2 是成为可复制的产品,还是成为一项昂贵的研究领先。

Reader comments

Conversation for this story loads after sign-in.