扩散模型驱动的机器人动作生成技术:从平均化到多模态决策的突破

graphite
2026-09-21 18:12:48
人工智能
具身智能
技术教程

扩散模型如今已广泛用于强化学习与机器人任务,但大家很少深入思考它背后的底层逻辑。因此本次报告不会提出一套大一统的顶层理论,而是围绕多个案例展开综述。在不少场景中,扩散模型总能带来显著性能提升,其背后的深层原因至今仍有很多未解之处。


Sergey Levine:机器人基础模型的强化学习


Sergey Levine 03.27最新talk : 机器人基础模型


大家可以把本次分享看作一系列现有技术的案例合集,而非一套完整的总结定论。最终的核心结论需要各位结合自身研究自行推导,我仅分享我团队的实践经验。本次分享聚焦连续控制,讲解扩散模型如何给强化学习、机器人领域带来颠覆性改变。



Image


1 扩散模型在RL与机器人领域的应用


大家可以回忆π机器人基模的demo,任务难度较高。这段视频距今已有两年:机器人自主折叠短裤。


该模型为数十亿参数规模,主干网络为视觉-语言架构,输出端采用DiT 架构扩散或流匹配模块,用于生成连续动作。


Image


自我们完成这项工作后,学术界与工业界陆续开发了大量面向机器人及其他场景的连续控制系统,能够完成各类精细、高灵巧度的操作任务。这套系统的运行逻辑如下:


模型输入多帧图像,本案例包含三路视觉输入:顶部全局相机、左右腕部机载相机,同时接入机器人关节编码器的连续读数(本体感知proprioception)。所有观测信息送入大型神经网络,网络输出action chunk


action chunk是一段短时动作序列,本案例包含50个时间步,总时长约1秒,对应机器人所有关节的目标位置、目标关节角度。执行时采用receding-horizon control:生成完整动作块后仅执行前25步,再重新采集观测、生成新的动作块,既非纯开环也非单步闭环更新。


控制领域标准符号定义:我们用代表policy,它是条件概率分布,给定状态(本任务为观测序列)输出动作分布;此处的动作实际是一段短时动作轨迹。以上基础逻辑非常直观。


早期端到端连续控制系统训练时,研究者普遍选用简单分布族——高斯分布:大型神经网络仅输出高斯分布的均值与协方差矩阵。


从强化学习理论角度看,完全可观测马尔可夫决策过程(MDP)中,最优策略可取为确定性,这让高斯分布看似是合理选择:均值对应确定性动作,仅附带微小噪声,训练过程中我们也希望噪声逐步收敛至0。但早期研究普遍忽视了分布族表达能力的重要性,尤其在模仿学习场景下,多模态行为会被单一高斯强行平均,性能缺陷会被急剧放大,这也是后续转向扩散模型的核心动机。


但当研究从简单系统的强化学习/模仿学习算法,转向基于海量真实数据的落地场景后,这套范式的缺陷彻底暴露。此时我们需要关注的不再是理论最优策略,而是从现有数据中能学到的最优策略


模仿学习场景中这一点尤为关键:模仿学习的目标只是复刻数据内的行为,不存在超越样本行为的优化过程;即便是当下主流强化学习,也会依靠大量历史数据完成训练初始化。


即便系统存在可等价表示的确定性最优策略,模型也很难单纯从数据中挖掘出来,数据本身的分布特性会直接决定策略性能。


举一个典型工程场景:训练无人机绕树飞行。存在两条可行路径,两条路线单独执行均安全有效,但直接对两条路径取平均会产生撞树的危险轨迹。 现实机器人数据集大量存在这类多模态行为,若强行用单一高斯分布拟合所有模态,将不同行为模式取平均,策略会彻底失效。仅依靠最优策略可取为确定性的理论推导,无法解决该工程难题。


扩散模型用于连续控制的核心原理十分简洁:不再让神经网络输出高斯分布参数,而是将整个网络改造为动作空间上的扩散或流匹配模型——并非图像扩散,而是针对动作序列建模。


Chi等人在《Diffusion Policy》论文中提供了直观可视化示意图,还原单段动作块的去噪生成全过程,能帮大家具象理解动作块的形态。


你提到高斯分布参数化,训练时每次都要从分布中采样动作,是这样吗?


主讲人:没错。但工程落地时,研究者大多直接取用分布均值执行控制,仅将高斯分布作为概率建模载体;高斯分布的概率密度会写入训练损失函数,作为优化目标的组成部分。


如果是模仿学习,训练目标就是极大似然估计;强化学习的目标逻辑是否大致相同?


主讲人:是的。大家可以简单把高斯策略理解为确定性策略,引入分布仅为了计算概率损失项。


2 扩散控制方法发展脉络


2.1 初代方案:Diffuser——trajectory-level unconditional diffusion2022


简单梳理该方向的发展历史与技术源头。据我所知,我的学生Michael JannerYilun Du合作发表了首个将扩散用于控制的论文,虽并非当下最主流方案,但属于该领域标志性的早期工作,能清晰展现技术演进思路。


Image


该论文提出Diffuser算法,直白地将图像扩散的思路迁移至控制任务:图像扩散是对像素分布建模,Diffuser直接替换建模对象为完整状态-动作轨迹。


轨迹被表示为二维矩阵:矩阵每一列对应一个时间步,每一行对应一个运动自由度;采用扩散流程生成整条轨迹。基于该特性可实现修复式条件生成(inpainting 搭配引导机制(guidance):固定轨迹首个时间步作为观测条件,补全后续所有动作,仅执行生成轨迹的第一个动作,完成控制、规划等任务。


模型内部引入时序卷积做分解优化,但核心逻辑仍是对完整轨迹做无条件扩散建模。


Diffuser作者团队基于该算法完成机械臂积木堆叠实验,通过引导(guidance)机制施加任务约束,实现堆叠操作。


扩散模型天然支持条件约束生成:若观测部分已知,可固定已知观测、补全未知轨迹;若需要添加任务约束、奖励目标,则通过引导机制实现。这是将经典扩散范式直接迁移至控制领域的最简方案,但并未成为行业主流。


2.2 主流方案:Diffusion Policy 2023


次年Chi等人提出的Diffusion Policy 成为当前行业标准,前文折叠短裤视频采用的正是该框架。论文配图看似复杂,实际底层逻辑极简,易用性远优于轨迹级无条件扩散。


Image


扩散策略本质是给定观测条件下的条件扩散模型。配图复杂是因为论文同时给出卷积网络、Transformer两套实现;目前行业全部采用Transformer版本,仅针对动作块构建条件扩散。


输入仅包含两部分:机器人观测、扩散迭代上一步的带噪动作。该方案命名直白,精准概括核心功能,便于领域传播,如今绝大多数扩散控制相关研究均基于此框架拓展。


3 Modern扩散策略架构与action chunk 关键特性


Image


当前最新扩散控制工作架构高度统一,核心设计与现代图像扩散模型高度契合:



  1. 基础模块:DiT 结构Transformer块;

  2. 观测条件融合:通过交叉注意力注入观测特征,也可采用Transfusion架构的全自注意力实现条件融合,两种方案差异较小,大家可简单理解为:DiT模块搭配交叉注意力观测编码器;

  3. 核心硬性设计:输出必须为action chunk,而非单步动作,执行采用滚动时域控制。


至今领域尚未完全解释为何动作块性能优势如此显著。直觉上每一时间步更新一次单动作的策略理应效果持平,但大量实证表明:



  • 模仿学习场景:动作块几乎是必备设计,无动作块的单步扩散策略基本无法收敛;

  • 强化学习场景:动作块非强制,但合理设计后可稳定提升性能。


执行阶段是仅运行动作块第一步,再重新生成完整动作块;还是开环执行整块动作序列?


主讲人:两种极端都不可取,工程上采用滚动时域控制,仅执行动作块的一部分。仅执行第一步会完全丧失动作块带来的性能增益,这是很多人的第一误区;也无需完整跑完50步。以开篇短裤折叠任务为例,50步动作块仅开环执行前25步,随后重新采集观测、生成下一段动作块。


这套框架是基于强化学习训练的吗?


主讲人:目前分享的全部内容都属于模仿学习范畴,强化学习部分我会在报告后半段展开,感谢提问。


4 机器人基础模型分支:VLA通用机器人模型


下面切换一条研究支线——机器人基础模型,初看与扩散策略无关,我会逐步串联二者,说明二者具备极强的适配性。


Image


4.1 机器人基础模型核心思路与Open X-Embodiment (OXE) / RT-X数据集实证


VLA 真的通用吗?—— 机器人具身策略的泛化性与记忆


机器人基础模型的核心目标:打造通用机器人,使其理解多样化自然语言指令、完成跨种类任务。实现该目标有两大前提:



  1. 海量多任务机器人数据集;

  2. 基于互联网预训练视觉-语言模型,赋予机器人图像、文本的理解能力。


主流落地范式:收集海量跨任务机器人数据,复用预训练视觉-语言模型(理解图文关联),基于机器人数据微调模型,使其输出控制动作。该方向近年热度极高,大量企业、实验室投入研发,且落地成果显著:大数据训练后的模型可完成大量复杂操作任务。


研究动机:通用模型在细分任务上,性能可超越针对该任务专门优化的专用模型。Open X-Embodiment (OXE) 数据集项目最早验证了该结论,基于该数据集训练出的模型系列为RT-X:项目联合全球34个实验室,汇总22类不同机器人采集的全部数据。


VLA入门(附代码)


走出实验室:VLA的现实考验


ICLR 2026 VLA 研究现状


Sergey Levine: Physical Intelligence 对通用机器人的追求


高雅人士鉴赏VLA(附推荐阅读清单)


面向真实机器人的监督策略学习


OXE-AugE:超 440 万条轨迹的跨本体机器人数据集


数据集样本统一约束:均为单机械臂、平行夹爪,除此之外相机视角、任务场景、物体形态完全多样化。数据集由Google团队主导,Quan Vuong整合全部数据训练通用机器人基础模型,再将模型发回7家参与实验室,与各家自研专用模型做对照测试。


Quan Vuong:π0.7,一款具备涌现能力的通用智能模型


Image


跨实验室平均指标对比:各家自研专用模型平均任务成功率41%;通用基础模型平均63%,整体性能提升近50%


Image


关键亮点:训练通用模型的研究员从未实地走访任何一家实验室,也未深度理解各细分任务,仅整合统一数据集完成训练,不存在针对特定场景过拟合的人工调优。该实验充分证明通用机器人模型具备真实性能增益,推动整个领域快速发展。


4.2 第一代视觉语言动作模型:离散符号动作方案(RT-2


初代机器人基础模型设计思路简单照搬视觉-语言预训练范式:


语言模型原生用于下一词元预测;若需要融合感知,将图像通过视觉编码器映射至与文本词元共享的嵌入空间,微调适配器后整体联合训练,实现图文统一表征。


研究者直接复用该架构,让模型额外输出机器人动作。初代方案粗暴地将动作转化为数字文本序列,和问答样本、图文样本混合训练。谷歌初代RT-2模型直接用数字字符代表连续动作,方案看似简陋,但有效提升了跨任务泛化能力。


Image


RT-2论文架构示意图中,训练样本包含两类:视觉问答样本、机器人操控样本。机器人样本等价于图文问答:输入指令(问题),输出数字序列(答案,代表动作)。


初代模型语言理解、图像识别能力优秀,但可执行任务都非常基础,并非刻意简化任务做演示,而是模型能力上限如此。


类比解释(非正式类比,下文简称运动皮层):视觉-语言模型相当于在语言大模型基础上外挂视觉皮层,视觉编码器负责将复杂像素转化为文本模型可读表征;同理,连续动作空间复杂度极高,初代模型缺少专门处理动作的运动皮层,因此精细操控能力薄弱。


4.3 第二代视觉语言动作模型:扩散或流匹配作为专用运动皮层输出头ππ₀₇Physical Intelligence


Image


第二代VLA模型新增独立神经网络模块,专门生成高精度连续动作,不再依靠离散数字符号表征动作,该模块普遍采用扩散或flow matching 模型,相当于机器人专属运动皮层。


π 是典型代表,行业同类架构设计思路趋同:采用混合Transformer主干,单独搭建DiT扩散/流匹配模块作为动作输出头,扩散模块可交叉读取视觉-语言主干的表征特征。


Image


演示案例:π自主完成洗衣全流程:驱动移动底盘抵达烘干机、取出衣物、移动至桌面、折叠全部织物。该方案距今两年,端到端自主运行整套长时序任务,虽偶尔出错,但整体流程稳定。


多次扰动实验:人为在折叠过程中新增杂物、打乱布料形态,基于扩散/流匹配策略的模型具备极强容错恢复能力。长期观测发现:相比离散词元化动作模型,该类策略面对操作失误时,修正、稳定自身轨迹的效果更优。


Image


最新迭代版本π₀₇沿用相同核心架构,优化语言指令解析模块,可理解精细化复杂指令:包含动作速度、容错阈值等细节描述,支持更多种类操控任务。模型仍会产生操作失误,但均可自主修正。


Image


近年大量相关工作落地:视频-动作模型、视觉-语言-动作模型,统一架构范式:



  1. 主干网络:互联网图文数据预训练,负责感知、语言理解;

  2. 独立输出支路:扩散/流匹配生成连续动作块(运动皮层模块)。


扩散/流匹配动作头与视觉语言主干是分开预训练的吗?


主讲人:标准流程是整体端到端微调,但下一页幻灯片会讲到该方案存在严重缺陷。


常规微调流程:先在互联网图文数据预训练视觉语言主干,拼接扩散/流匹配动作模块,随后全部参数联合端到端训练。但我们一年前发现这套流程存在两大核心痛点,我们提出了一套折中优化方案——Knowledge Insulation2025,虽不够优雅,但能有效缓解问题,目前领域仍有更优解法的探索空间。


4.4 训练痛点解决方案:Knowledge Insulation2025 混合训练框架


Image


两大原生训练缺陷



  1. 训练速度极差:纯端到端扩散/流匹配微调收敛速度慢5~10倍,扩散/流匹配模型损失方差高,收敛周期极长;模型为数十亿参数规模,升级至更大参数量后,需要数百块高端GPU持续训练数周,算力成本极高;

  2. 语言能力退化:扩散/流匹配模块梯度反向传播会破坏视觉语言主干预训练表征,微调完成后模型解析自然语言指令的性能大幅下降,初代(\pi)出现该明显缺陷。


解决方案:Knowledge Insulation混合架构


核心操作:在扩散/流匹配动作专家模块与视觉语言主干之间添加梯度截断(stop gradient,阻断扩散/流匹配损失梯度更新主干网络。 仅截断梯度不足以适配机器人任务,主干仍需学习机器人场景专属视觉、语言特征,因此引入双损失混合训练:



  1. 离散动作损失:基于数字符号动作,梯度正常回传更新主干,完成表征微调,训练速度与纯离散模型持平;

  2. 扩散/流匹配动作损失:梯度被截断,仅更新动作专家输出头,不破坏主干图文表征,保证连续动作灵巧度。


这套看似兼顾两套方案短板的混合架构,实际综合性能最优。π系列模型训练中更多采用流匹配作为动作生成模块。


实验曲线解读



  1. 简单任务(仅离散动作即可解决):


    • 黄色曲线(知识隔离混合训练):收敛速度与纯离散动作模型完全一致,训练效率拉满;

    • 深色曲线(纯端到端扩散/流匹配微调):收敛缓慢、最终性能持平;


  2. 高难度精细操作任务(依赖连续扩散/流匹配动作):


    • 纯离散模型:最终任务完成率显著偏低;

    • 无梯度截断的离散+扩散/流匹配联合训练:性能小幅提升;

    • 知识隔离完整方案(梯度截断+双损失):最终性能大幅领先所有基线,同时训练速度提升约5倍。



我的判断:该混合框架仅为临时折中方案,扩散/流匹配控制模型原生训练效率低的底层问题仍未解决,后续存在巨大优化空间。


离散动作损失的输出来自视觉语言主干,而非扩散/流匹配动作头,对吗?


主讲人:没错。序列排布逻辑:图像输入+文本指令离散数字动作序列,计算离散损失;通过注意力掩码隔离扩散/流匹配模块,扩散分支无法读取离散动作表征,独立生成动作块。


为什么大家如此看重训练速度?是用于在线实时训练场景吗?


主讲人:最直接的原因是算力成本。数十亿参数量模型训练动辄消耗数百块GPU数周算力,升级至更大参数量后,训练预算成本会指数级上涨。


更深层的学术意义:训练速度直接等价于固定算力预算下的模型上限。若限定一周训练周期,收敛更快的框架能学到更优策略;遵循缩放定律时,单位算力下学习效率越高,扩充数据、参数量后最终性能越强。


梯度截断是否意味着主干网络全部权重冻结?


主讲人:主干权重并未冻结,仅扩散/流匹配模块向主干的梯度被截断;离散动作损失依旧正常更新主干所有参数。


5 扩散模型赋能离线在线强化学习


下面进入报告下一章节:强化学习场景下的扩散模型,结论会超出大家固有认知。先铺垫强化学习基础工具,再讲解扩散带来的核心突破。


Image


5.1 离线强化学习基础:函数、贝尔曼最优方程与分布偏移(distribution shift)灾难


强化学习基础逻辑:智能体执行动作,环境反馈状态与奖励信号;优化目标为最大化长期累积期望奖励,选择能获取更高回报的动作。


Image


机器人领域核心需求:离线预训练+在线微调混合范式。传统强化学习纯在线交互采集数据,成本极高;我们希望依托海量历史离线数据集完成策略初始化,再通过少量真机交互在线优化。例如用(\pi)模仿学习扩散策略做初始化,再通过强化学习进一步提升成功率。


该范式分为两个阶段:



  1. 离线阶段:仅利用他人采集的历史数据集训练,不与真实环境交互,目标是从多分布异构数据中提炼最优行为;例如汇总多名人类驾驶员行车数据,训练出优于单个人类驾驶员的通用策略;

  2. 在线微调阶段:将离线预训练策略部署真机,通过实时交互持续优化。


整套范式存在双重难点:离线阶段稳定训练、在线阶段不丢失预训练能力。


Image


核心工具:函数与贝尔曼最优方程


函数定义:给定状态、动作,遵循策略后续所有动作能获得的总回报。


策略迭代基础逻辑:训练收敛的函数后,直接取即可得到更优策略,交替迭代更新、更新策略。


最优满足贝尔曼最优方程:


基于该方程的标准优化方案:最小化方程左右两侧差值,适用于任意离策略、离线数据集,无需数据由当前策略采集,是离线强化学习的理论基石。


Image


致命缺陷:分布偏移(distribution shift)灾难


模仿学习仅复刻数据内行为,不会改变策略分布;但强化学习目标是优化行为,生成数据集不存在的新动作。


Image


函数基于历史数据分布训练,而优化后的新策略动作分布与数据集分布存在巨大差异,即分布偏移。


标准Q学习中等价于在确定性分布下取期望;仅当训练的数据分布与策略分布近似时,估值才准确。离线场景下二者天然不一致,会引发灾难性估值过估计:策略会刻意生成欺骗函数、看似高回报但实际效果极差的对抗性动作,导致训练完全失效。


过去六七年领域大量研究围绕缓解分布偏移展开,主流思路为conservative / pessimistic offline RL,如CQL保守价值正则


5.2 conservative / pessimistic offline RL的在线微调退化问题


保守价值正则核心逻辑:对数据集外未知动作,默认其真实回报极低。实现方式为引入保守正则项: 优化目标包含两项:



  1. 保守惩罚项:压低偏离数据分布的对抗动作估值;

  2. 数据正则补偿项:最大化数据集内样本动作的估值。


二者相互制衡:若生成动作与数据集样本高度近似,两项抵消,不会引入额外偏差;若动作脱离数据分布,则强制压低估值。可视化理解:真实价值函数为绿色曲线,拟合函数为蓝色曲线;价值峰值(最优动作)拟合误差最大,保守正则专门压低峰值估值,规避过估计。


Image


保守类离线算法可稳定完成离线训练,但进入在线微调阶段会出现致命性能崩塌:


离线训练阶段奖励持续上升并收敛饱和,启动在线交互微调后,策略性能大幅下滑,需要大量交互样本才能缓慢恢复至原有水平。


工程风险类比自动驾驶:离线数据集训练完成后,上线在线强化学习初期,车辆会频繁出现碰撞风险,需要消耗大量测试车辆才能修复。


退化底层原因


保守训练得到的函数仅在数据集分布内估值可靠,远离数据分布区域估值严重偏低、误差极大。在线探索的核心是生成全新、分布外动作,这些样本携带巨大梯度,直接破坏已经收敛的价值函数,造成性能崩塌。


Image


长期存在强力基线RLPD:完全放弃离线预训练,在线训练每一批次数据混合50%离线历史数据,仅做在线强化学习。该极简方案性能长期超越所有复杂离线转在线算法,说明传统保守范式存在本质短板。


Image


5.3 约束型离线强化学习:高斯策略天然短板与扩散模型的突破


另一类离线RL范式放弃修改函数,转而约束策略优化目标:最大化值,同时添加正则约束,保证新策略与数据集分布差异不能过大。


Image


该思路提出多年,但在高斯策略框架下始终效果有限:数据集行为为多模态分布,单一高斯仅有两种取舍:



  1. 平均所有模态:生成大量低概率、危险中间动作,分布偏移严重;

  2. 仅保留单一模态:丢弃绝大多数数据样本,浪费数据集信息。


强化学习理论认为MDP存在可等价表示的确定性最优策略,无需高表达分布族;但实证证明:高表达能力扩散/流匹配策略搭配分布约束范式,可完美解决上述问题,彻底规避保守正则带来的在线退化。


落地难点:扩散模型原生适配模仿学习极大似然,难以直接优化值;近年涌现大量算法解决扩散策略的价值优化问题,其中最简、落地效果最优的为Diffusion Steering (DSRL2025) 扩散引导强化学习


5.4 落地算法:Diffusion Steering (DSRL2025) 扩散引导强化学习原理与实验效果


Image


算法流程



  1. 离线阶段:仅用模仿学习基于历史数据训练扩散/流匹配策略,学习从高斯噪声映射至数据集内合理动作;每一组高斯噪声输入,均对应分布内有效动作;

  2. 强化学习不直接更新扩散/流匹配模型主干,额外训练独立网络:输入观测状态,输出送入扩散模型的噪声向量;

  3. 在噪声向量空间执行标准soft actor-critic 强化学习,天然规避分布外动作,不存在欺骗函数的对抗样本,不会与classifier guidance概念混淆。


Image


实验结果



  1. 实体机器人实验:蘑菇摆放操作,仅50次在线交互样本即可完成任务;

  2. 离线强化学习标准基准:长时序迷宫、解谜任务,性能达到当前SOTA水平;


该框架同时适配离线、在线场景,无需复杂保守正则,仅依靠模仿预训练扩散模型即可打通全流程。


噪声服从高斯分布,若噪声向量脱离高斯支撑集,是否依然会生成分布外动作?


主讲人:噪声空间的分布边界极易约束,直接给噪声向量施加单位球范围限制即可;传统动作空间无法预知分布支撑边界,这是二者核心区别。


长时序解谜任务中,奖励仅在通关时为1、其余时刻为0,值如何计算?


主讲人:该任务采用折扣回报,值等价于带指数折扣的剩余通关步数。


Image


6 规模化融合方案:视觉语言基础模型 + 扩散/流匹配策略 + 强化学习 π


完整融合范式总结


当下机器人基础模型最具前景的研究方向:大规模融合模仿学习扩散/流匹配策略与强化学习,我们团队Physical Intelligence开发 π框架落地该思路。


π*0.6:一个能从经验中学习的 VLA


Image


架构创新:将value / advantage conditioning 嵌入视觉语言动作模型的文本提示词;模型同时接收自然语言指令、动作价值条件;测试时输入高价值条件,扩散/流匹配模块自动生成最优动作块,配套在线强化学习微调,完美适配离线转在线场景。


Image


真实工业落地案例



  1. 全自动咖啡机任务:连续稳定运行13小时,偶尔故障时可自主清洁咖啡机恢复作业,持续产出咖啡;在线强化学习微调后稳定性大幅提升;

  2. 巧克力工厂包装盒组装:自主折叠纸盒、粘贴标签、码放至货箱,供工厂装填巧克力。策略依靠扩散/流匹配生成动作块,强化学习基于真机交互持续优化。


Image


量化指标


柱状图对比:绿色柱为仅离线模仿训练的任务吞吐量(每小时成功完成任务数量);黄色柱为叠加在线强化学习后的吞吐量。所有测试任务吞吐量均有显著提升。


整套框架支持单模型统一学习全部任务,融合离线模仿数据、在线强化学习数据、价值条件提示,训练通用高性能机器人策略。


Image


问答


扩散策略仅能覆盖预训练数据集的分布支撑集,是否存在固有局限?常规KL散度正则要么趋单一模态、要么全覆盖;你是否测试过Wasserstein距离等分布度量,平衡两种特性?


主讲人:斯坦福大学Chelsea Finn课题组Perry Dong提出一套相关方案:扩散模型输出基础动作,叠加独立残差策略输出动作偏移量。若限制残差偏移幅度,整体动作与数据集分布的偏差存在上界,本质等价于瓦瑟斯坦距离约束,完美平衡模态覆盖与分布偏移风险。


Chelsea Finn & Perry Dong:真实场景强化学习实现VLA后训练


离线预训练、在线微调的范式,是否存在对应推理阶段的类比方案?


主讲人:行业已有成熟落地方案,可类比为测试时增强计算。


策略采样择优:从扩散策略中批量生成多组候选动作块,全部送入函数评估回报,执行估值最高的动作序列。该方法适配DSRL扩散引导等所有扩散强化学习框架,搭配使用可稳定提升成功率,可理解为模型测试阶段的短时深度推理。


你提到扩散策略容错修正能力更强,但视频预测领域条件扩散模型普遍存在误差累积,画面色彩持续漂移。为什么机器人控制场景该问题得到缓解?


主讲人:两类领域的预期标准完全不同。从事机器人控制研究,我对误差累积的容忍阈值极低,而扩散策略实际误差累积程度远低于我的预期,因此主观感受上容错极强;视频生成领域研究者默认无漂移,出现微小误差便会认为缺陷严重。


扩散控制无法彻底消除误差累积,仅问题严重程度大幅降低。



 原文链接:https://mp.weixin.qq.com/s/3FcrF5l6woWUm7nfEh2xTg


34
0
0
0
关于作者
相关文章
  • AI4Materials研究范式的转变
    传统材料研究依靠直觉试错;AI推动其向数据驱动、算法引导范式转型。专用AI:作用于材料发现全流 ...
    了解详情 
  • 北京大学李彤阳:量子计算的未来,在于找到真正属于自己的问题 ...
    了解详情 
  • 多组学一次搞清!组学小白速进~
    基因组、转录组、蛋白组、代谢组……它们到底研究什么?有什么区别? 这篇帮你一次 ...
    了解详情 
  • AI绕过3D结构预测,实现RNA设计,登《Science》封面 ...
    了解详情 
领取成功
本月5个550bit真机配额已发放给您,配额将在2个月后到期,请及时使用哦~
活动中心
联系我们
二维码
返回顶部
返回
活动中心

完成任务,轻松获取真机配额

×
每日必做
新手任务
长期任务
其他任务
快速回复 返回顶部 返回列表
玻色有奖小调研
填写问卷,将免费赠送您1个1000bit真机配额
(单选) 您是从哪个渠道得知我们的?*
您是从哪个社交媒体得知我们的?*
您是通过哪个学校的校园宣讲得知我们的呢?
取消

提交成功

真机配额已发放到您的账户,可前往【云平台】查看

量子AI开发者认证

考核目标

开发者能够成功搭建Kaiwu-PyTorch-Plugin项目基础环境,并成功运行示例代码,根据示例提示,输出指定的值并填写至相应的输入框中。

通过奖励

5个一年效期的1000量子比特真机配额

专属「量子AI开发者」社区认证标识

开发者权益

每月固定权益:5个550量子比特真机配额
前往考核

第一步

按照README提示成功安装Kaiwu-PyTorch-Plugin库环境依赖
前往GitHub

第二步

运行 community-assessment 分支下的 run_rbm.py 代码示例

第三步

理解示例代码,手动打印并填写如下数值:

正相采样的状态

负相采样的状态

正相的能量值

负相的能量值

*

提交答案

开发者权益

每月固定权益:5个550量子比特的真机配额

恭喜您完成考核

您将获得量子AI开发者认证标识及考核奖励

1000 bit*5

配额

Quantum AI Developer Certification

Assessment Objectives

Developers should successfully set up the basic environment for the Kaiwu-PyTorch-Plugin project, run the QBM-VAE sample code, and calculate the correct FID value based on the random seed value provided by the system.

Pass Rewards

10 quotas for 550-qubit real quantum machines with a one-year validity period

Exclusive "Quantum AI Developer" Community Certification Badge

Developer Benefits

Fixed Monthly Benefits: 5 quotas for 550-qubit real quantum machines
Proceed to Assessment

Step 1

Install the environment dependencies for the Kaiwu-PyTorch-Plugin library according to the README instructions
Go to GitHub

Step 2

Replace the Seed Value

Your seed value is

Step 3

Enter the FID Value You Calculated

*

Submit Answer

Developer Benefits

Fixed Monthly Benefits: 5 quotas of 550-qubit real machines

Congratulations on Completing the Assessment

You will receive the Quantum AI Developer Certification Badge and Assessment Rewards

550bit*10

Quotas