一站式支撑机器人策略评估、模型规划与动作提取三大具身任务。
——统一世界建模
目录
01 掩码视觉动作完整技术实现逻辑
掩码动作:把动作直接“画”进视频画面
两类互补掩码数据集构建方案
轻量化LoRA微调方案,无全量重训开销
三大下游标准化应用链路
02 横向定位:四类机器人视频世界路线对比
03 实验结果
验证掩码接口不可替代性
跨本体零样本泛化测试
下游任务定量表现
04 一套掩码输入自由切换两大核心功能
李飞飞课题组联合马里兰、哈佛等机构推出Masked Visual Actions(掩码视觉动作),只用一套视频模型、仅15小时虚实混合数据微调:
既能输入机器人轨迹预测环境交互,也能输入物体目标运动反推机器人动作。
在单臂机械臂、定制夹爪、人形双臂机器人三类从未见过的设备上全部稳定运行,解决动作表征与视觉预训练模型不兼容、跨本体泛化差、双向建模需分开训练三大难点,为通用机器人仿真、离线策略评测提供轻量化统一底座。
01 掩码视觉动作完整技术实现逻辑
整套框架基于开源14B Wan视频基座模型微调,核心创新是像素级掩码动作接口,配套双数据集构建管线、统一双向推理逻辑,无需新增大量神经网络模块,仅靠LoRA轻量化微调即可落地。
整体架构简洁、适配各类桌面与仿真机器人场景。
▲Masked Visual Actions完整技术总览图
掩码动作:把动作直接“画”进视频画面
摒弃数值动作向量,把任意实体(机械臂/待操作物体)时序轨迹渲染为画面掩码,掩码区域像素完整保留、其余画面填充统一灰色,作为模型输入条件。
简单理解:模型原生任务是视频补全,掩码区域作为已知先验,灰色区域是需要预测的未知画面,天然贴合视频模型预训练的图像修复逻辑,不需要额外跨模态转换层。
对于研究中的核心条件分布:
(灰色画面|掩码实体轨迹,初始帧),掩码实体集合
自由切换,切换实体就能切换模型推理方向。
- 若
为机器人:正向动力学模型,给定机械臂运动,预测杯子、抽屉等物体交互变化;
- 若
为目标物体:逆向动力学模型,给定物体想要到达的轨迹,自动生成配套机器人抓取、搬运动作。
▲正向、逆向掩码推理可视化对比图
这套设计最大优势是本体无关,掩码只记录像素层面运动轮廓,不绑定机器人关节维度、夹爪结构,从未训练的人形双臂机器人输入掩码后,也能生成无穿模、符合物理逻辑交互视频。
两类互补掩码数据集构建方案
研究提供的分割、渲染两条数据生成路径,分别适配真实视频与仿真场景,二者互补解决掩码获取难点。
- 分割式数据集:
依托SAM分割模型,直接从DROID真实机器人视频里分割机械臂像素,无需机器人URDF模型与相机标定,零成本快速生成大量真实掩码样本;
缺陷是遮挡区域掩码存在信息泄露,测试时无法自定义任意新动作轨迹。
- 渲染式数据集:
读取视频同步记录的机器人关节状态,加载URDF三维网格结合相机外参渲染半透明机械臂掩码,夹爪高亮红色方便模型识别。
优势是推理阶段能手动生成任意全新动作掩码;短板必须完整标定相机与机器人参数,仅仿真与带状态记录的真实数据集可用。
整套训练数据仅合计15小时,融合DROID真实人机视频、Robocasa仿真操作片段,同时纳入任务失败轨迹,保证模型学会异常交互场景预测。
▲分割法与渲染法数据集优劣对比表
轻量化LoRA微调方案,无全量重训开销
基座14B视频大模型完整参数冻结,仅用秩256 LoRA分支微调掩码补全任务,8张H200 GPU训练约10000步,4天即可完成收敛。
训练损失仅采用视频重建损失,无需额外动作对齐损失,掩码区域作为条件不参与损失计算,仅约束灰色未知区域像素生成精度。训练完成后单权重文件无分支拆分,前向、逆向推理共享一套参数,不用维护两套模型权重。
三大下游标准化应用链路
微调完成的模型可直接接入机器人开发全流程,落地了三类工业可用场景:
- 策略离线评估:
批量仿真机器人执行轨迹,用多模态大模型Gemini 3.1 Pro自动打分,不用真机反复试错磨损硬件,仿真成功率与真实机器人执行相关系数r=0.982,参考价值极高;
▲仿真与真实任务成功率相关性散点图
- 基于模型规划(Best-of-N):
从扩散策略采样多条候选动作掩码,输入模型预判每条轨迹交互结果,筛选最优动作下发真机,RoboCasa全任务平均成功率提升7%~26%;
▲各类方法动作提取任务成功率柱状图
- 逆向动作提取:
输入人类演示的物体运动掩码,模型生成对应机器人操作视频,搭配逆动力学模型输出可执行关节动作,无需专门逆向任务训练,零样本完成物体轨迹到机器人控制量转换。
02 横向定位:四类机器人视频世界路线对比
当前机器人视觉动作建模分为四条主流技术路线,从数据成本、双向建模、跨本体泛化、工程成本四个维度做客观横向对比:
- 关节/骨架数值条件基线(Ctrl-World、VAP)
优势:动作向量存储空间小,训练代码成熟;
短板只能正向预测,跨本体生成机器人严重扭曲,更换夹爪、人形机器人性能暴跌,BEHAVIOR数据集PSNR仅18.39,同条件本文22.90,泛化差距明显。
▲不同视觉条件消融定量对比表
- 单一机器人掩码方案(Mask2IV、BridgeV2W)
优势:像素对齐、单机器人精度高;
短板掩码只能固定机械臂实体,无法切换物体做逆向推理,一套模型仅适配单一机型,复用性差。
- 文本引导视频世界模型
优势:通用性强、无需动作输入;
短板空间指代模糊,杂乱桌面环境容易混淆目标物体,无法精准控制精细抓取轨迹,不适合操作类机器人。
03 实验结果
实验分为消融对比、跨本体泛化、三大下游任务三块,全部采用DROID真实机器人、Robocasa仿真、BEHAVIOR人形机器人三类数据集,不单纯罗列指标,拆解数值背后实际工程意义。
验证掩码接口不可替代性
消融变量分为末端可视化、骨架可视化、本文掩码视觉动作三类,指标选用LPIPS(越小越好)、SSIM、PSNR(越大越好):
▲三类条件输入定性效果对比图
- 训练集同机型DROID场景:三类方案指标差距不大,骨架 PSNR 22.74,本文 23.74,基线差距微小;
- 同款机器人更换非标夹爪:骨架LPIPS升至0.169,本文仅0.148,稀疏条件出现明显精度衰减;
- 未见过的人形双臂BEHAVIOR机器人:骨架 LPIPS 0.162,本文低至 0.123,PSNR 高出 3.51,泛化优势完全拉开。
指标局限:PSNR、LPIPS 仅衡量画面像素相似度,无法量化物理合理性;
骨架基线数值尚可,但人形机器人生成出现肢体穿插、悬浮等违背物理的画面,纸面高分不代表能用于真机规划。
跨本体零样本泛化测试
核心实验:全程未用人形机器人数据训练,直接输入双臂掩码做推演。
▲未见人形机器人仿真效果图
Ctrl-W、骨架基线生成人形机器人肢体错位、单臂膨胀变形;本文掩码方案完整还原双臂开门、搬运动作,物体接触、推拉交互无失真。
本质原因在于骨架、末端条件是机器人专属稀疏特征,掩码是通用像素运动表征,不绑定机器人结构,不受关节数量、外形约束。
下游任务定量表现
- 策略评估:
仿真任务成功率与真机高度线性相关(r=0.982),但模型存在轻微乐观偏差,仿真打分普遍略高于真实机器人,仅能作为筛选参考,不能完全替代真机测试;
▲真实与仿真任务进度分布小提琴图
- 模型规划:
随候选动作采样数量提升,任务成功率稳步上涨,N=10样本时平均成功率提升19%,证明模型能精准区分有效/无效操作轨迹;
- 逆向动作提取:
仅靠正向训练权重零样本完成物体轨迹转机器人动作,RoboCasa咖啡摆放任务成功率90%,高于ACT、molVLA等传统模仿学习基线,无需单独训练逆向网络。
04 一套掩码输入自由切换两大核心功能
过去想要同时实现前向预测与逆运动求解,只能搭建两套独立网络,数据与算力成本翻倍。
Masked Visual Actions用像素掩码打通视频大模型与机器人交互的适配壁垒,用同一套掩码输入自由切换正向仿真、逆向动作生成两大核心功能。
大幅降低机器人数据采集成本:仅15小时虚实混合数据完成微调;
跨机器人通用仿真底座:单臂、定制夹爪、人形双臂不用重新训练;
逆向建模无需额外标注人类动作:直接从物体运动推导机器人操作。
该工作给通用机器人世界模型提供一条轻量化新思路:不用强行改造视频基座,只通过视觉掩码对齐动作与像素先验,就能低成本实现跨本体双向建模;后续若融合深度、激光输入,拓展移动底盘时序掩码,或将覆盖室内导航、户外巡检更多机器人品类。
Ref
参考论文:Masked Visual Actions for Unified World Modeling
论文链接:https://arxiv.org/pdf/2607.19343
项目主页:https://masked-visual-actions.github.io