Video + Embodied 的一系列工作
Vera
Paper:Turning Video Models into Generalist Robot Policies
论文总结:不要再让大型视频模型直接学机器人 action。视频模型其实已经很擅长根据语言和当前场景“想象任务完成后的未来视频”,真正困难的是怎样把这个视觉计划可靠地变成具体机器人动作。作者因此提出 VERA,把系统拆成两部分:一个 14B 的 action-free 视频模型负责规划未来 RGB,一个机器人专属的 J-IDM 负责控制。J-IDM 不直接从两帧图像黑盒回归 action,而是预测每个像素对各个 action channel 的 Jacobian,也就是‘某个动作会让图像怎么动’,然后根据视频模型产生的 optical flow 反解机器人动作。
Motivation:具身领域的基础模型有两大路线:
- VLA:VLM 能依赖互联网级别的文本和图像数据,但是 Action 数据很稀缺,因此泛化一般。
- Video Generation:输出未来像素,然后再得到 Action。
如何处理多视角?
- 直接把不同的摄像头横向拼成一张很宽的 RGB 图像
图里的 J-IDM 怎么操作的?
- 传统方法是 D-IDM(Direct IDM),也就是直接将两张图丢给 Transformer,然后吐 Action,但是这个映射太黑盒了,没有利用任何先验,数据需求会很大。
- 论文提出 J-IDM
经典 Robot 雅可比矩阵:
:机器人 action 的小变化; :机器人某个点在空间里的移动; :描述“动作如何造成空间运动”的局部线性映射。
也就是 Jacobian 会告诉我们 action 的每一个维度改变一点,机器人上的点会朝哪个方向移动多少。
Qwen-RobotWorld
Paper:Qwen-RobotWorld Technical Report: Unifying Embodied World Modeling through Language-Conditioned Video Generation
模型结构如上,MMDiT 有两个 stream:
- Understanding Stream:Qwen 2.5-VL 得到的 Language Representation。
- Generation Stream:加噪后的 Video Latent。
什么是 Sence2Robot?
也就是把人手替换成机械手。
输入有 3 段视频:
- Sence Video:原始场景,但是人的手被 Mask 或者 Inpaint
- Simulated Robot Video:机器人运动参考,先将人手动作转变成 end-effector trajectory,再让目标几人在模拟器中进行
- Noise Prediction Token
Sence2Robot 数据怎么获得?
理想数据:
1 | |
但是这样配对的数据很难获得,于是论文决定采用合成数据。
整体的 Pipeline 如下:
1 | |
Video + Embodied 的一系列工作
https://d4wnnn.github.io/2026/08/16/Notion/Video + Embodied 的一系列工作/