本帖最后由 宇宙微尘 于 2026-7-20 18:49 编辑
视觉-语言-动作模型(VLA)在具身策略学习中展现了强大的语义泛化能力,然而它们学习的是反应式的观察-动作映射,并未显式建模物理世界在干预下如何演化。标准世界模型(WM)虽然能预测未来观测,却无法输出可执行的运动指令。世界动作模型(World Action Models, WAM)作为新一代具身基础模型,将环境状态预测与动作生成统一在同一框架中,联合建模未来状态与动作的联合分布。本文整合复旦大学、新加坡国立大学及 Moss 团队 2024–2026 年间发布的三篇领域首份系统性综述,统一概念定义、融合互补分类体系,梳理架构路线、数据来源、评测标准与未来方向,完整呈现 WAM 全领域技术图谱。
———
为什么需要 WAM?三大具身范式的核心差异
从概率建模的视角出发,可以清晰地界定三类具身基础模型的本质差异。
VLA 将机器人控制建模为多模态序列映射任务。模型处理当前观测 o_t 和语言指令 l,生成动作序列 a_t,其优化目标为 P(a_t | o_t, l)。RT-2、OpenVLA、π₀ 等代表性工作利用大语言模型的预训练语义潜空间,将感知输入直接映射到动作空间,在场景泛化上取得了可观的进展。但这类模型的根本局限在于:无显式世界动力学建模,不会预判动作带来的环境变化。面对遮挡、接触、形变等需要物理推理的任务场景,反应式映射极易失效。此外,VLA 的训练高度依赖昂贵的机器人遥操作标注数据,无法利用互联网上海量的无标注视频资源。
标准世界模型(WM)被定义为内化物理环境因果动力学的预测性转移函数,建模环境观测状态随动作干预的演化 P(o_{t+1} | o_t, a_t)。从 Sora 到 Dreamer 系列再到 V-JEPA,世界模型在想象未来方面取得了显著进展。然而,世界模型仅做仿真可视化,未绑定动作解码链路,无法直接用于机器人闭环控制——它能想象未来,却不能将这种想象转化为可执行的运动指令。
WAM 正是为解决这两种割裂而提出的。它必须同时满足两个核心准则:前向预测建模,即模型必须生成或表征未来状态 s_{t+1}(像素、潜变量、3D 几何、触觉等任意形式均可);动作耦合约束,即动作推导必须与其预测的未来状态严格对齐,耦合形式可以是联合概率输出或级联潜空间中的策略条件化。其优化目标同时覆盖未来状态与动作的联合似然,使得 WAM 天然具备三项 VLA 和传统世界模型都不具备的能力:融合视频预训练中的物理先验,兼容机器人标注数据与无标注人类视频等多源数据,以及通过反事实推演实现长时序预判与零样本跨具身迁移。
在概念边界上需做几点澄清。视频动作模型(Video Action Models, VAM)是 WAM 的子集,仅限定像素视频作为预测载体,而 WAM 覆盖点云、光流、特征、触觉等多模态表征,范畴更广。视频策略(Video Policy)仅复用视频主干提取特征,无显式未来预测监督,不属于严格 WAM。动作世界模型(Action World Models, AWM)是早期命名,侧重世界模型附加动作头,WAM 则将预测与动作置于平等核心地位,定位通用具身基座。

世界动作模型(World Action Models, WAMs)代表性工作的时序演进与分类体系
WAM 诞生的核心动机直指两个行业痛点。其一是数据瓶颈:利用海量无标注第一人称人类视频学习物理交互先验,可大幅降低机器人数据采集成本。其二是泛化缺陷:通过反事实推演预判不同动作的物理后果,能有效提升模型在未知物体、陌生场景和长时序任务中的鲁棒性。
———
WAM 架构分类体系:级联与联合的分合之争
WAM 的架构设计围绕一个核心问题展开:世界预测与动作生成应该耦合到何种程度?整个领域据此分化为级联 WAM(Cascaded WAM)和联合 WAM(Joint WAM)两大分支,覆盖 2024–2026 年间全部代表性工作。
级联 WAM 显式分解优化目标,形式上为
P(a_t, o_{t+1} | o_t, l) = P_θ(o_{t+1} | o_t) · P_φ(a_t | o_{t+1}, o_t)。
世界预测模块与动作解码模块完全解耦,分阶段训练,推理串行执行。这条路线按中间表征的形式再分为两条子路径。
显式像素级级联完整生成 RGB 未来视频,再通过逆动力学模型(IDM)或几何跟踪(光流/6D 位姿估计)从中提取动作,代表工作包括 UniPi、VLP、AVDC。其优势在于画面可解释性强,且可复用大规模视频生成预训练模型;缺陷则是逐帧生成叠加逐帧动作解码的双重开销导致推理延迟极高,难以满足实时控制需求。
隐式潜变量级联训练完整的视频 VAE 或扩散模型,但在推理阶段跳过像素解码器,仅使用中间潜变量生成动作,代表工作包括 VPP、mimic-video、S-VAM。这种做法在保留视频预训练先验的同时将算力需求削减近半,大幅降低推理延迟,但代价是丢失了可视化校验能力——无法直观检查中间预测是否合理。
联合 WAM 直接建模联合分布 P(a_t, o_{t+1} | o_t, l),世界预测与动作头共享主干网络,联合损失同步优化,按生成范式分为两大阵营。
自回归联合 WAM 将视觉帧和动作统一序列化为 Token,采用 GPT 式因果自回归预测。GR-1、GR-2 等采用解耦输出头架构,视觉与动作使用独立解码器但共享 Transformer 主干。CoT-VLA、WorldVLA 统一离散词表,将视觉 VQ Token 与动作 Token 纳入同一 LLM 词表进行联合建模。VLA-JEPA 则走向纯潜空间预测路线,不生成像素,仅预测抽象未来特征,实现极致轻量化。

级联 WAM 结构示意图对比。1(a) 学习动作:世界模型生成显式的像素空间未来规划,再由学习得到的逆动力学模型或动作模型映射为动作。1(b) 几何提取:显式视觉规划通过几何提取转换为动作或轨迹。2(a) 隐式表征:中间规划载体为隐式未来表征而非未来 RGB 帧,下游动作模型从中解码可执行指令

自回归联合WAM
扩散/流匹配联合 WAM 是当前产出最密集的主流方向。它基于 DiT(Diffusion Transformer)视频扩散框架,同步降噪未来画面与动作,扩散模型的迭代精炼特性天然适合需要精细物理推理的接触类操作。按骨干结构,统一流(Unified Stream)用单一 DiT 主干统一处理视觉与动作隐变量,代表工作为 DreamZero、Cosmos Policy、PAD;多流(Multi-Stream)则为视频和动作分别配置独立 DiT,通过交叉注意力或隐藏态交互实现耦合,代表工作包括 CoVAR、DUST、DiT4DiT。此外还有共享表征的变体设计,视觉与动作先通过统一编码器融合,再解码为各自输出。不同结构策略代表了该领域在架构耦合方式上的主要探索方向,而非严格的顺序替代关系。

基于扩散模型的联合世界-动作模型(WAMs)主要架构模式分类。1(a) 统一流:世界与动作整合于单一 DiT 主干网络中,世界建模以显式或隐式方式实现。2(a) 多流——交叉注意力耦合:独立的视频 DiT 与动作 DiT 通过显式交叉 注意力机制进行耦合。2(b) 多流——隐状态耦合:视频 DiT 的中间隐状态对动作 DiT 进行条件约束。2(c) 多流——共享 表征:视频与动作首先通过统一编码器融合,再解码为各自的输出
———
WAM 训练数据生态:四类异构数据的协同策略
WAM 相比传统 VLA 在数据层面的核心优势,在于能够吸纳四类异构数据源进行混合训练——从几乎零成本的海量互联网视频到极其昂贵的精确遥操作标注,覆盖了完整的数据光谱。
机器人遥操作数据(OXE、DROID、RH20T)包含精准对齐的观测-动作-下一观测三元组,虚实鸿沟最小,但采集成本极高、场景覆盖单一,主要用于最终阶段的控制精度微调。UMI 便携人类演示数据(FastUMI、RealOmni)通过低成本可穿戴设备在户外场景中采集,人类动作经重定向算法映射至机器人,用于预训练交互动力学,但仍存在人形与机械形态之间的结构差距。仿真数据集(ManiSkill、RoboCasa、RoboTwin)可以无限批量生成并附带完美的 3D 几何、深度和触觉标注,主要用于底层动力学预训练,但面临仿真到现实的迁移间隙。

用于训练世界动作模型(World Action Models)的具身数据全景概览,按迁移难度(Y 轴)和扩展难度(X 轴)
互联网第一人称视频是 WAM 独有的数据红利,也是它与 VLA 在数据策略上的分水岭。Ego4D、HowTo100M 等数据集包含数万小时的日常活动记录,虽然没有动作标签,但每一帧都蕴含丰富的物理交互信息——手与物体的接触动力学、物体在推力与重力下的运动模式、液体和可变形材料的响应行为。WAM 通过潜动作建模和规划条件化训练等机制,可以从中学习通用物理常识,再以少量机器人标注数据完成领域适配。四类数据的协同策略本质上是分工明确的:人类视频负责灌输物理直觉,机器人数据负责校准控制精度。
———
分层评测体系:从"画面好看"到"实际能抓"
WAM 的评测不能简单沿用视频生成模型的指标体系。一张未来画面可能在像素层面无可挑剔,但物体的运动轨迹是否服从物理定律?基于此生成的抓取动作在真实机器人上能否成功?相关综述为此提出了三层递进评测框架,逐层筛选出真正具备实用价值的模型。
第一层是视觉保真度,涵盖 PSNR、SSIM、FVD、DINO 相似度等像素和感知层面的质量指标,确保生成内容在视觉上基本合理。第二层是物理常识评测,直接考察物体动力学合理性、碰撞检测准确率和流体行为一致性——这一层的核心问题是,画面中的物理过程是否经得起推敲。第三层是最关键的动作可行性评测,在仿真和真机环境中直接测量任务成功率、跨形态泛化能力和接触操作精度。
目前领域已积累超过 40 个评测平台,覆盖单臂(MetaWorld、LIBERO、RLBench)、双臂协同、人形全身控制和移动操作等多种形态,以及刚体、形变物体和液体等不同接触类型。这套分层设计解决的恰好是行业中长期存在的一个通病:视频生成指标表现优异的模型,部署到真机后可能完全无法完成任务。

世界模型评估指标与基准综述
———
领域现存核心挑战与未来研究方向
WAM 领域目前面临若干尚未解决的基础性问题,涉及架构、时序、安全与评测多个维度。
在架构层面,级联与联合、单流与多流之间缺乏标准化的消融实验,各自在独立设置下报告结果,横向对比结论基本缺失。隐式 WAM 的能力上限尤其引人关注——跳过像素解码器所损失的视频预训练先验,在泛化能力上究竟意味着多大的代价?这个关键权衡目前仅有直觉层面的判断,缺乏定量分析。在时序层面,随着预测步数增加,累积误差急剧放大,长程规划的可靠性始终是悬而未决的难题;而将高层任务规划与底层动力学预测统一到单一模型中的分层时序抽象方案,至今缺乏令人信服的实现。
安全部署是通往工业应用时绕不开的关卡。错误的未来预测会驱动模型输出基于幻觉的危险动作,而当前的 WAM 既不具备对自身预测置信度的校准能力,也缺少在物理异常发生时自动截断执行的安全机制。评测的标准化同样是一块短板——各团队使用不同的协议和基准,跨方法、跨任务的公平比较难以开展。
未来研究正沿几条明确的方向推进。自适应表征推理的核心设想是让模型根据任务需求动态调整渲染粒度——精细接触与形变操作使用像素或潜变量级的高保真预测,简单导航任务则完全跳过视频生成,实现算力的按需分配。多模态统一 WAM 将视觉、触觉、力觉和 3D 几何联合纳入预测框架,瞄准的是布料折叠、液体倾倒、精密装配等纯视觉无法独立解决的接触密集型任务。安全感知 WAM 则通过引入不确定性估计与异常检测模块,在预测的物理后果即将失控时主动截断动作输出,为真机部署提供必要的安全保障。标准化数据与评测平台的建设,则是整个领域从各自为战走向可复现研究的前提条件。
———
总结
WAM 代表了具身智能从"反应式控制"到"预测式决策"的范式跃迁。VLA 的先天短板在于缺乏物理预判能力且训练严重依赖昂贵的机器人标注数据;WAM 通过联合建模未来状态预测与动作生成,打通了"预测世界"与"执行动作"之间的闭环。领域正在凝聚一个关键的共识:不再追求极致高清的完整未来画面,只保留对动作决策真正必要的物理表征——Dream Less。当前挡住 WAM 大规模落地的并非生成画质,而是物理一致性、实时推理速度和标准化评测三大瓶颈。随着级联与联合两大架构路线持续演进、四类异构数据融合训练日益成熟、分层评测体系逐步完善,WAM 正在从学术概念走向真机部署。理解 WAM 的意义不在于记忆一个新名词,而在于看清整个具身智能领域从"反应"到"预判"的底层逻辑重构。
参考链接:https://arxiv.org/pdf/2504.16054
原文链接:https://mp.weixin.qq.com/s/Xt9lhTApXaRjIiSROFUKEA
|