Video + Embodied 的一系列工作

Vera

Paper:Turning Video Models into Generalist Robot Policies

论文总结:不要再让大型视频模型直接学机器人 action。视频模型其实已经很擅长根据语言和当前场景“想象任务完成后的未来视频”,真正困难的是怎样把这个视觉计划可靠地变成具体机器人动作。作者因此提出 VERA,把系统拆成两部分:一个 14B 的 action-free 视频模型负责规划未来 RGB,一个机器人专属的 J-IDM 负责控制。J-IDM 不直接从两帧图像黑盒回归 action,而是预测每个像素对各个 action channel 的 Jacobian,也就是‘某个动作会让图像怎么动’,然后根据视频模型产生的 optical flow 反解机器人动作。

Motivation:具身领域的基础模型有两大路线:

  • VLA:VLM 能依赖互联网级别的文本和图像数据,但是 Action 数据很稀缺,因此泛化一般。
  • Video Generation:输出未来像素,然后再得到 Action。
image.png

如何处理多视角?

  • 直接把不同的摄像头横向拼成一张很宽的 RGB 图像

图里的 J-IDM 怎么操作的?

  • 传统方法是 D-IDM(Direct IDM),也就是直接将两张图丢给 Transformer,然后吐 Action,但是这个映射太黑盒了,没有利用任何先验,数据需求会很大。
  • 论文提出 J-IDM

经典 Robot 雅可比矩阵:

  • :机器人 action 的小变化;
  • :机器人某个点在空间里的移动;
  • :描述“动作如何造成空间运动”的局部线性映射。

也就是 Jacobian 会告诉我们 action 的每一个维度改变一点,机器人上的点会朝哪个方向移动多少。

Qwen-RobotWorld

Paper:Qwen-RobotWorld Technical Report: Unifying Embodied World Modeling through Language-Conditioned Video Generation

image.png

模型结构如上,MMDiT 有两个 stream:

  • Understanding Stream:Qwen 2.5-VL 得到的 Language Representation。
  • Generation Stream:加噪后的 Video Latent。

什么是 Sence2Robot?

也就是把人手替换成机械手。

image.png

输入有 3 段视频:

  • Sence Video:原始场景,但是人的手被 Mask 或者 Inpaint
  • Simulated Robot Video:机器人运动参考,先将人手动作转变成 end-effector trajectory,再让目标几人在模拟器中进行
  • Noise Prediction Token

Sence2Robot 数据怎么获得?

理想数据:

1
2
3
4
5
6
输入:
某个人在真实厨房里拿起杯子

目标:
同一个厨房、同一个杯子、同一个动作
但把“人的手”换成 Franka / Aloha / humanoid

但是这样配对的数据很难获得,于是论文决定采用合成数据。

整体的 Pipeline 如下:

1
2
3
4
5
6
7
8
9
10
11
12
13
14
15
16
Human demonstration video

1. MANO reconstruction
恢复人的 3D 手部姿态

2. Retargeting
把人手运动映射成机器人 end-effector trajectory,然后IK得到Joint Trajectory

3. Human-hand removal
把视频中的人手去掉

4. MuJoCo robot rendering
让目标机器人沿对应轨迹运动

5. Compose into scene
把机器人放回原来的真实场景

Video + Embodied 的一系列工作
https://d4wnnn.github.io/2026/08/16/Notion/Video + Embodied 的一系列工作/
作者
D4wn
发布于
2026年8月16日
许可协议