KNOWLEDGE NOTE · 持续修订

世界模型:画面、状态与行动各自证明什么

用输出契约区分视频生成、可计算仿真与行动规划,避免把视觉效果当成物理能力。

作者分析 · 复核于 · 如何使用这些判断

“世界模型”适合描述研究方向,却不足以定义一份产品验收单。同样是一段杯子被推动的视频,一个系统可能只生成画面,另一个保存可计算的物体状态,第三个据此选择机器人的动作。三者的错误会造成不同后果。

先问下游拿到什么

World Labs 在 2026 年 6 月提出按功能区分 renderer、simulator 和 planner。我借用这个分类帮助分析产品;它是一个研究团队的提案,不是统一标准。原文

下游得到的东西 我的验收问题
画面与声音 镜头是否连续,指定对象是否保持一致,修改是否可控?
可计算的场景状态 尺度、碰撞、材质和状态变化能否支持目标计算?
行动或行动序列 在给定观测与限制下,任务能否安全完成,失败能否识别?

这张表不是模型排行榜。一套系统可以同时承担几项职责,也可以把职责交给不同模块。

可看与可用之间,需要一个明确的转换

视频给出了一个可能的未来,但机器人还需要动作的坐标、时间、力度以及执行后的新观测。三维场景可以支持漫游,也未必包含适合接触任务的材料参数。把结果接入下游时,应写清楚保留了什么,估计了什么,哪些量根本不存在。

例如,将生成场景用于机器人训练,至少要检查比例、碰撞几何、动作接口和任务结果定义。这里的重点是检查项目自身的训练契约,不是要求每种娱乐内容都具有工程仿真的精度。

数据价值来自补上哪一种缺口

真实视频可以丰富外观与事件知识;带动作和结果的机器人轨迹,才让特定执行条件进入数据。DROID 和 OpenVLA 展示了真机数据、任务适配与策略学习的具体路径,不能据此跳到“看完互联网视频就会做家务”。DROIDOpenVLA

评估新增数据时,我会比较同一组任务上的失败类型:是对象没认对、接触时滑落、没有察觉失败,还是下一步计划错误。数据规模只有落到这些差别上,才有产品意义。

目前保留的判断

生成、仿真与规划可能相互提供训练信号,但“可能融合”不能当作已经具备通用行动能力的证据。白皮书中的产业讨论在这里拆成三个可单独验证的问题:结果是否可控、状态是否可信、行动是否可靠。它们也分别连接创作软件、空间工具和机器人。

公开来源与适用范围

  • World Labs · A Functional Taxonomy of World Models

    研究团队的分类提案 · 以输出功能区分 renderer、simulator、planner;不是业界统一定义,不代表能力已经融合。

  • OpenVLA

    研究项目与论文 · 视觉语言动作模型的训练与评测;只支持论文所披露的任务和实验条件。

  • DROID

    研究数据集 · 跨场景真机操作数据及采集基础设施;规模不能替代特定任务适配。