Ego2Robot

Paper:Ego2Robot: Scalable Robot Data Synthesis from Egocentric Human Data

输入:两种 ego 视频,作者支持两条输入路径:

  • Path A:视频本身已经有 hand pose 标注,比如 EgoDex、ViTRA、EgoVerse 等。
  • Path B:只有普通第一视角视频,没有手姿态。此时先用 WiLoR 做逐帧 3D hand pose estimation,再用 DynHaMR 做时序优化;长视频还会用 Qwen3.5 切成一个个完整操作子任务并生成文字指令。

然后进行 Action Alignment:把“人手运动”翻译成“机器人夹爪运动”

人手有很多关节,但论文不试图完整模仿手指,而是把它压缩成一个平行夹爪表示:

手腕/拇指/食指等关键点 → TCP 位置 + 夹爪方向 + gripper opening → robot end-effector trajectory

然后Visual Alignment:把画面里的“人手”换成“机器人”

  • 用 SAM3 去除人手
  • 自动寻找机器人底座的位置
    • 尝试多个机器人底座位置,每个都求 IK,看有多少姿态可达,选择可达性最高的位置。
    • 不同机械臂适应范围不同。
  • 在 MuJoCo 中渲染机械臂。
image.png

Ego2Robot
https://d4wnnn.github.io/2026/08/16/Notion/Ego2Robot/
作者
D4wn
发布于
2026年8月16日
许可协议