西安交通大学许翔宇团队提出Fast LeWorldModel(Fast-LeWM),针对视觉世界模型在规划阶段的自回归rollout瓶颈,将传统的step-by-step潜变量预测改造为trajectory-level并行预测。其核心思路是在CEM规划中不再用一步转移模型反复rollout,而是把不同长度的动作前缀作为预测单元,一次并行输出执行1到H个动作后的全部未来潜变量,并通过密集前缀监督迫使模型学会状态沿动作序列的连续演化过程。实验显示,在相同评测协议下,Fast-LeWM将动态模块耗时从31.4s压缩至8.0s(约4倍加速),完整CEM求解时间从54.4s降至28.3s(减少48%),规划成功率则从LeWM的85.8%提升至90.5%,加入自一致性约束后进一步达到92.0%。

背景
在视觉规划与具身智能中,世界模型被认为是智能体走向通用决策能力的核心组件:在真正执行动作之前,先在潜在空间中"想象未来",再选择最优行为。但这个想象过程往往很慢。
以LeWorldModel(LeWM)为例,其在CEM规划中存在一个根深蒂固的效率瓶颈:每评估一条候选动作序列,模型都需要沿imagined trajectory一步步自回归rollout——先预测下一步latent,再把预测出的latent输入dynamics model继续预测下一步。这种设计带来两个问题。其一,规划慢。CEM需要反复评估大量候选动作序列,每一条都从头rollout,动态模块耗时严重。其二,误差累积。早期预测的微小偏差沿轨迹传播,后面越滚越偏,影响规划质量。
针对这一瓶颈,西安交大团队提出Fast-LeWM,试图从根本上改变世界模型的预测范式:从step-by-step rollout切换为trajectory-level parallel prediction。
方法
Fast-LeWM由三个组件构成。

Fast-LeWM 的 pipeline
视觉编码器(Visual Encoder)。将当前观测o_t和未来观测o_{t+1}, ..., o_{t+H}映射到潜变量空间,分别得到当前latent z_t和未来latent集合。其中z_t作为模型输入,未来latent作为训练监督目标。
动作前缀编码器(Action-Prefix Encoder)。这是Fast-LeWM区别于其他方法的核心设计。给定一条长度为H的候选动作序列,编码器通过causal Transformer将其处理为一组prefix tokens——第k个prefix token仅包含前k个动作的信息。考虑到同样的动作在不同初始位置、物体状态和接触条件下会产生不同后果,实际实现中还会把当前latent z_t映射为state token,置于动作序列最前端,为动作编码提供上下文信息。
并行潜变量预测器(Parallel Latent Predictor)。以当前latent z_t和全部prefix tokens为输入,一次性并行输出所有未来latent预测。

训练阶段,Fast-LeWM对每一个前缀都施加监督,而非仅监督最终状态。目标函数在SIGReg防坍塌正则的基础上,对所有H个前缀的潜变量预测误差求和。这使得模型不仅学习状态的局部变化,还要学习动作逐步累积时状态如何连续演化——这也是Fast-LeWM区别于LeWM的关键所在。
测试阶段,Fast-LeWM沿用LeWM的CEM规划协议,但将rollout方式从逐步推进改为前缀直达:对于长度为H的候选动作序列,模型通过对应的prefix token直接从当前latent建立到未来latent的预测路径。额外的自一致性评分(self-consistency scoring)是可选项——模型一方面从完整长度H的动作前缀预测终点,另一方面先预测一个中间latent再从中间继续预测剩余时域,两种终点预测之间的差异作为一致性惩罚项加入CEM打分。当惩罚权重β=0时退化为标准goal distance打分,β>0时可筛选在不同前缀分解下预测一致的候选序列,进一步提升规划稳定性。
结果
实验沿用LeWM的goal-conditioned latent planning协议,在Two-Room、Reacher、PushT和OGBench-Cube四个环境上评测。

成功率方面,Fast-LeWM在四个任务上的平均成功率从LeWM的85.8%提升至90.5%;加入自一致性约束后进一步提升至92.0%。
效率提升更为显著。在相同CEM budget、单张NVIDIA 4090上,Fast-LeWM的dynamics time从31.4s降至8.0s,加速约4倍(包含动作编码和predictor预测时间);完整CEM solve time从54.4s降至28.3s,减少48.0%。在开环条件下,Fast-LeWM想象未来时的latent误差及其随horizon的增长率也明显低于原始LeWM。
消融实验
作者通过消融实验验证了各组件的独立贡献。

一个看似直接的加速思路是将动作块变长,让一次transition覆盖更长时间。作者构造了Long-Action LeWM,将action encoding从5个primitive actions改为25个,但效果并不理想。Terminal-only Fast-LeWM仅监督最终latent而不监督中间前缀,表现优于Long-Action LeWM但仍低于完整模型。这揭示了两件事:action prefix本身已是有效的长时域表示,但密集前缀监督对学习连续状态演化仍然不可或缺。
此外,去除state token后模型在多个任务上性能下降,印证了动作编码需要有效的上下文信息才能泛化到不同初始状态。
总结
Fast-LeWM给出的核心启示并非简单的加速技巧,而是一个更本质的判断:对于面向规划的世界模型,动态模型的接口设计本身可能与表征学习目标同样重要。相比一步步预测"下一个latent",直接预测动作前缀所对应的多时域未来状态,或许是让视觉世界模型走向高效规划的一条更直接路径。
当然,当前方法仍有边界:实验集中在相对短时域的视觉规划任务上,前缀并行预测在更长horizon下的扩展性有待验证;自一致性评分的权重β需手动调节,缺乏自适应机制。但总体来看,这项工作标志着世界模型正在从"逐步想象未来"走向"并行生成未来",这种范式转换的影响力可能超越单篇论文本身。
论文链接:https://arxiv.org/pdf/2606.26217
项目主页:https://fast-lewm.github.io/
代码:https://github.com/Yuntian-Gao/Fast-LeWorldModel
原文链接:https://mp.weixin.qq.com/s/JIvkoo1pKkzup4Q6RdTLyQ
|