Fei-Fei Li(李飞飞)表示,World Labs 希望 AI 在超越聊天机器人的层面上理解空间

The World Labs 的联合创始人押注于面向创作者、设计师和机器人研究人员的持久三维环境。

By · Published

Primary source: Bloomberg Technology

Why it matters

World Labs has raised at least $1.23B to make spatial models a foundation for creative software and robotics. The bet succeeds only if generated worlds preserve the geometry and physics required for reliable action.

World Labs lays out its $1B plan to move AI beyond chatbots — Fei-Fei Li says spatial models will reach designers and roboticists before they produce a viral consumer moment.

Fei-Fei Li 在周三发布的 Bloomberg Technology 采访 中,阐明了 World Labs 背后的赌注:语言模型学会了“说话”,而她的新公司打算教会机器如何在三维空间中“理解”和“行动”。

World Labs 正在追求语言理解与物理理解之间的鸿沟。聊天机器人可以描述一个房间。具有空间智能的系统则会对其几何结构建模、预测其中会发生什么,并最终帮助人或机器人改变该空间。

这一赌注延续了 Li 的职业轨迹。她主导创建了 ImageNet,这个视觉数据库和基准帮助加速了现代计算机视觉的发展;她在 2013 年到 2018 年间领导 Stanford AI Lab,并曾担任 Google Cloud 的 AI 与机器学习首席科学家。World Labs 为她提供了一个机会,将数十年的视觉智能研究转化为一家产品公司,并获得异常深厚的资金支持。

Li 与计算机视觉和图形学研究人员 Justin Johnson、Christoph Lassner 和 Ben Mildenhall 联合创立了 World Labs。Johnson 在 Li 手下完成了他的 Stanford 博士学位,研究方向包括视觉推理、图像生成和三维推理。Mildenhall 共同创建了 Neural Radiance Fields,即 NeRF,一种通过图像重构三维场景的方法。Lassner 曾在 Epic Games 和 Meta Reality Labs Research 从事图形与三维重建研究。

Marble is the product version of Li's thesis

World Labs 的第一个命名产品 Marble 于 2025 年 11 月 12 日正式推出。World Labs 表示,Marble 可以从文本、图像、视频或粗略布局生成持久的、可导航的 3D 环境。用户可以编辑并组合这些环境,然后导出为视频、网格或 Gaussian splats。

这种输出格式是 World Labs 推介的核心。生成的视频为观众提供一个固定的帧序列。Marble 的目标是生成一个可以被反复访问、编辑并从不同位置检查的环境。对于设计师、游戏开发者和视觉特效艺术家而言,商业价值在于能更快速地将一个想法或参考图像转化为可用的空间资产。

World Labs 声明的客户群包括创作者、游戏与视觉特效工作室、建筑师、设计师、机器人研究人员和仿真开发者。这种面向专业领域的聚焦为公司在其更宏大的机器人雄心成熟之前提供了更近的市场。建筑可视化、虚拟制作、游戏原型和产品设计可以容忍仍需人工审查的生成环境。而用于训练机器人的仿真器则面临更严格的标准,因为几何、运动或物理行为上的错误可能导致在现实世界中失败的策略。

$1.23B buys time for a difficult technical bet

World Labs 在 2024 年 9 月公开亮相,并筹集了 2.3 亿美元。Andreessen Horowitz、NEA 和 Radical Ventures 支持了这轮融资,且 Andreessen HorowitzRadical Ventures 各自支持 Li 关于空间智能可以成为新的创意与工业软件基础的论点。

在 2026 年 2 月 18 日,World Labs 宣布了又一笔 10 亿美元融资,将其公开披露的资本总额提升到至少 12.3 亿美元。World Labs 将 AMD、Autodesk、Emerson Collective、Fidelity Management & Research Company、Nvidia 和 Sea 列为投资者。Bloomberg 报道 指出 Autodesk 向本轮投资贡献了 2 亿美元。

投资者名单也展示了世界模型如何迅速成为战略性基础设施。Nvidia 在资助 World Labs 的同时也在开发自己的用于物理 AI 的 Cosmos 3 平台。Google DeepMind 的 Genie 3 则从文本生成交互式环境,并强调实时导航、一致性与模拟事件。

World Labs 正在把其边界圈定为持久、可编辑且可导出的世界,并以仿真作为创意工具与机器之间的桥梁。Li 将世界模型划分为渲染器、规划器和模拟器。渲染器为人类生成像素以供观看。规划器为智能体选择动作。模拟器试图保留几何、物理和动力学,以便人类和机器都能使用结果。

World Labs 在 7 月 21 日向模拟器层迈出了一步,当时它收购了机器人公司 SceniX。World Labs 表示,这次整合将连接世界模型、基于学习的仿真以及来自现实世界机器人训练的反馈。该交易使 Li 在 Marble 面向创作者的产品之外,拥有一个机器人业务,从而将她宏大的空间智能论点转化为两条更明确的市场路径。

The physics still has to work

单靠视觉质量无法证明生成的环境就是对物理世界的可靠建模。2026 年 5 月一篇介绍 CRONOS 基准 的研究论文发现在其评估的开源视频生成器中存在大量反事实一致性失败。当研究人员在保留底层物理事件不变的情况下改变视点、物体外观或场景上下文时,预测结果会发生变化。

CRONOS 并未评估 Marble,因此其发现并不能证明 World Labs 的产品存在缺陷。但这些结果定义了 Li 所选择的技术门槛。一个对创作有用的环境可以容忍不完全准确的反射或小的几何瑕疵。用于训练机器人的模拟器则必须在相机移动或物体外观变化时保持一致响应。

Li 的优势在于她的创始团队围绕计算机视觉、神经渲染和三维推理构建,同时拥有足够的资本能并行推进研究与产品开发。与该优势相伴的负担也很明确:World Labs 必须证明其环境能支持可靠的行动,而不仅仅是作为令人印象深刻的人类可探索场景。

其他前沿实验室也在寻找超越提示框的界面和模型能力。RuntimeWire 在六月报道 Mira Murati 的 Thinking Machines Lab 正在探索连续的音频、文本和视频交互。Li 做出的是一个更具物理性的赌注。World Labs 希望 AI 在智能体尝试在空间内执行任何操作之前,先构建出该智能体周围空间的表征。

决定性里程碑将出现在这些生成的世界成为设计师、工程师和机器人的可靠工作环境之时。Li 已经召集了为此尝试所需的研究人员和资本。现在,Marble 和对 SceniX 的收购必须证明空间智能不仅是一条引人注目的科学方向,也能成为一门可行的生意。

Reader comments

Conversation for this story loads after sign-in.