Ego2Robot
Paper:Ego2Robot: Scalable Robot Data Synthesis from Egocentric Human Data
输入:两种 ego 视频,作者支持两条输入路径:
- Path A:视频本身已经有 hand pose 标注,比如 EgoDex、ViTRA、EgoVerse 等。
- Path B:只有普通第一视角视频,没有手姿态。此时先用 WiLoR 做逐帧 3D hand pose estimation,再用 DynHaMR 做时序优化;长视频还会用 Qwen3.5 切成一个个完整操作子任务并生成文字指令。
然后进行 Action Alignment:把“人手运动”翻译成“机器人夹爪运动”
人手有很多关节,但论文不试图完整模仿手指,而是把它压缩成一个平行夹爪表示:
手腕/拇指/食指等关键点 → TCP 位置 + 夹爪方向 + gripper opening → robot end-effector trajectory
然后Visual Alignment:把画面里的“人手”换成“机器人”
- 用 SAM3 去除人手
- 自动寻找机器人底座的位置
- 尝试多个机器人底座位置,每个都求 IK,看有多少姿态可达,选择可达性最高的位置。
- 不同机械臂适应范围不同。
- 在 MuJoCo 中渲染机械臂。
Ego2Robot
https://d4wnnn.github.io/2026/08/16/Notion/Ego2Robot/