Fast LeWorldModel:用动作前缀并行预测,让世界模型动态估计加速4倍

宇宙微尘
2026-07-09 16:57:23
人工智能
具身智能
论文精读与讲座笔记

西安交通大学许翔宇团队提出Fast LeWorldModel(Fast-LeWM),针对视觉世界模型在规划阶段的自回归rollout瓶颈,将传统的step-by-step潜变量预测改造为trajectory-level并行预测。其核心思路是在CEM规划中不再用一步转移模型反复rollout,而是把不同长度的动作前缀作为预测单元,一次并行输出执行1到H个动作后的全部未来潜变量,并通过密集前缀监督迫使模型学会状态沿动作序列的连续演化过程。实验显示,在相同评测协议下,Fast-LeWM将动态模块耗时从31.4s压缩至8.0s(约4倍加速),完整CEM求解时间从54.4s降至28.3s(减少48%),规划成功率则从LeWM的85.8%提升至90.5%,加入自一致性约束后进一步达到92.0%。




背景


在视觉规划与具身智能中,世界模型被认为是智能体走向通用决策能力的核心组件:在真正执行动作之前,先在潜在空间中"想象未来",再选择最优行为。但这个想象过程往往很慢。


以LeWorldModel(LeWM)为例,其在CEM规划中存在一个根深蒂固的效率瓶颈:每评估一条候选动作序列,模型都需要沿imagined trajectory一步步自回归rollout——先预测下一步latent,再把预测出的latent输入dynamics model继续预测下一步。这种设计带来两个问题。其一,规划慢。CEM需要反复评估大量候选动作序列,每一条都从头rollout,动态模块耗时严重。其二,误差累积。早期预测的微小偏差沿轨迹传播,后面越滚越偏,影响规划质量。


针对这一瓶颈,西安交大团队提出Fast-LeWM,试图从根本上改变世界模型的预测范式:从step-by-step rollout切换为trajectory-level parallel prediction。


方法


Fast-LeWM由三个组件构成。


 



Fast-LeWM 的 pipeline


视觉编码器(Visual Encoder)。将当前观测o_t和未来观测o_{t+1}, ..., o_{t+H}映射到潜变量空间,分别得到当前latent z_t和未来latent集合。其中z_t作为模型输入,未来latent作为训练监督目标。


动作前缀编码器(Action-Prefix Encoder)。这是Fast-LeWM区别于其他方法的核心设计。给定一条长度为H的候选动作序列,编码器通过causal Transformer将其处理为一组prefix tokens——第k个prefix token仅包含前k个动作的信息。考虑到同样的动作在不同初始位置、物体状态和接触条件下会产生不同后果,实际实现中还会把当前latent z_t映射为state token,置于动作序列最前端,为动作编码提供上下文信息。


并行潜变量预测器(Parallel Latent Predictor)。以当前latent z_t和全部prefix tokens为输入,一次性并行输出所有未来latent预测。



训练阶段,Fast-LeWM对每一个前缀都施加监督,而非仅监督最终状态。目标函数在SIGReg防坍塌正则的基础上,对所有H个前缀的潜变量预测误差求和。这使得模型不仅学习状态的局部变化,还要学习动作逐步累积时状态如何连续演化——这也是Fast-LeWM区别于LeWM的关键所在。


测试阶段,Fast-LeWM沿用LeWM的CEM规划协议,但将rollout方式从逐步推进改为前缀直达:对于长度为H的候选动作序列,模型通过对应的prefix token直接从当前latent建立到未来latent的预测路径。额外的自一致性评分(self-consistency scoring)是可选项——模型一方面从完整长度H的动作前缀预测终点,另一方面先预测一个中间latent再从中间继续预测剩余时域,两种终点预测之间的差异作为一致性惩罚项加入CEM打分。当惩罚权重β=0时退化为标准goal distance打分,β>0时可筛选在不同前缀分解下预测一致的候选序列,进一步提升规划稳定性。


结果


实验沿用LeWM的goal-conditioned latent planning协议,在Two-Room、Reacher、PushT和OGBench-Cube四个环境上评测。



成功率方面,Fast-LeWM在四个任务上的平均成功率从LeWM的85.8%提升至90.5%;加入自一致性约束后进一步提升至92.0%。


效率提升更为显著。在相同CEM budget、单张NVIDIA 4090上,Fast-LeWM的dynamics time从31.4s降至8.0s,加速约4倍(包含动作编码和predictor预测时间);完整CEM solve time从54.4s降至28.3s,减少48.0%。在开环条件下,Fast-LeWM想象未来时的latent误差及其随horizon的增长率也明显低于原始LeWM。


消融实验


作者通过消融实验验证了各组件的独立贡献。



一个看似直接的加速思路是将动作块变长,让一次transition覆盖更长时间。作者构造了Long-Action LeWM,将action encoding从5个primitive actions改为25个,但效果并不理想。Terminal-only Fast-LeWM仅监督最终latent而不监督中间前缀,表现优于Long-Action LeWM但仍低于完整模型。这揭示了两件事:action prefix本身已是有效的长时域表示,但密集前缀监督对学习连续状态演化仍然不可或缺。


此外,去除state token后模型在多个任务上性能下降,印证了动作编码需要有效的上下文信息才能泛化到不同初始状态。


总结


Fast-LeWM给出的核心启示并非简单的加速技巧,而是一个更本质的判断:对于面向规划的世界模型,动态模型的接口设计本身可能与表征学习目标同样重要。相比一步步预测"下一个latent",直接预测动作前缀所对应的多时域未来状态,或许是让视觉世界模型走向高效规划的一条更直接路径。


当然,当前方法仍有边界:实验集中在相对短时域的视觉规划任务上,前缀并行预测在更长horizon下的扩展性有待验证;自一致性评分的权重β需手动调节,缺乏自适应机制。但总体来看,这项工作标志着世界模型正在从"逐步想象未来"走向"并行生成未来",这种范式转换的影响力可能超越单篇论文本身。



论文链接:https://arxiv.org/pdf/2606.26217 


项目主页:https://fast-lewm.github.io/ 


代码:https://github.com/Yuntian-Gao/Fast-LeWorldModel


原文链接:https://mp.weixin.qq.com/s/JIvkoo1pKkzup4Q6RdTLyQ


118
0
0
0
关于作者
相关文章
  • World Action Models:具身智能的下一个前沿
    视觉-语言-动作模型(VLA)在具身策略学习中展现了强大的语义泛化能力,然而它们学习的是反应式 ...
    了解详情 
  • Janus-QUBO:一种兼具对偶性感知的基于可调量子启发式景观探索化 ...
    一、背景介绍​在广阔的化学空间中发现新分子是一项核心科学挑战,利用深度生成模型(DGMs)进行 ...
    了解详情 
  • 正式公布 | 2026CAAI-玻色量子计算应用创新基金入选名单 ...
    CAAI-玻色量子计算应用创新基金由中国人工智能学会和玻色量子公司共同发起,2025年首届基金成效 ...
    了解详情 
  • 驱动mRNA药物设计:LinearDesign与UTR-LM如何实现UTR-CDS协同优 ...
    中国科学院上海药物研究所郑明月/李叙潼团队在《Journal of Advanced Research》发表综述,系统 ...
    了解详情 
领取成功
本月5个550bit真机配额已发放给您,配额将在2个月后到期,请及时使用哦~
活动中心
联系我们
二维码
返回顶部
返回
活动中心

完成任务,轻松获取真机配额

×
每日必做
新手任务
长期任务
其他任务
快速回复 返回顶部 返回列表
玻色有奖小调研
填写问卷,将免费赠送您1个1000bit真机配额
(单选) 您是从哪个渠道得知我们的?*
您是从哪个社交媒体得知我们的?*
您是通过哪个学校的校园宣讲得知我们的呢?
取消

提交成功

真机配额已发放到您的账户,可前往【云平台】查看

量子AI开发者认证

考核目标

开发者能够成功搭建Kaiwu-PyTorch-Plugin项目基础环境,并成功运行示例代码,根据示例提示,输出指定的值并填写至相应的输入框中。

通过奖励

5个一年效期的1000量子比特真机配额

专属「量子AI开发者」社区认证标识

开发者权益

每月固定权益:5个550量子比特真机配额
前往考核

第一步

按照README提示成功安装Kaiwu-PyTorch-Plugin库环境依赖
前往GitHub

第二步

运行 community-assessment 分支下的 run_rbm.py 代码示例

第三步

理解示例代码,手动打印并填写如下数值:

正相采样的状态

负相采样的状态

正相的能量值

负相的能量值

*

提交答案

开发者权益

每月固定权益:5个550量子比特的真机配额

恭喜您完成考核

您将获得量子AI开发者认证标识及考核奖励

1000 bit*5

配额

Quantum AI Developer Certification

Assessment Objectives

Developers should successfully set up the basic environment for the Kaiwu-PyTorch-Plugin project, run the QBM-VAE sample code, and calculate the correct FID value based on the random seed value provided by the system.

Pass Rewards

10 quotas for 550-qubit real quantum machines with a one-year validity period

Exclusive "Quantum AI Developer" Community Certification Badge

Developer Benefits

Fixed Monthly Benefits: 5 quotas for 550-qubit real quantum machines
Proceed to Assessment

Step 1

Install the environment dependencies for the Kaiwu-PyTorch-Plugin library according to the README instructions
Go to GitHub

Step 2

Replace the Seed Value

Your seed value is

Step 3

Enter the FID Value You Calculated

*

Submit Answer

Developer Benefits

Fixed Monthly Benefits: 5 quotas of 550-qubit real machines

Congratulations on Completing the Assessment

You will receive the Quantum AI Developer Certification Badge and Assessment Rewards

550bit*10

Quotas