URDFormer

Paper:URDFormer: A Pipeline for Constructing Articulated Simulation Environments from Real-World Images

作者发现真实的 Image → URDF 训练数据十分稀缺,因此采用了一个很好的思路

先从已知 URDF 生成逼真的图片,再把这个过程反过来训练。

具体步骤如下:

  • 首先程序化生成一个仿真场景 z
  • 随后在模拟器中渲染出比较粗糙的图片,再利用 Stable Diffusion 等图像生成模型,把粗糙渲染转换成逼真的 RGB 图片。
image.png

在推理时,给模型一张真实的照片,首先模型用 GroundingDINO 检测物体框/部件框,然后URDFormer 预测每个框的类别,空间信息,父子关系。最后组合成 URDF。

为什么分成 Global 和 Part 两个模型?

作者没有直接用一个模型同时预测整个厨房和所有细粒度部件,而是拆成两级。

  • Global:预测场景结构
    • 输入整个厨房的照片以及高层的物体框,主要预测每个大物体的位置和尺寸,父子关系,大物体挂在哪面墙上。
  • Part:预测物体内部结构。
    • 再裁剪出一个具体的物体,比如柜子,然后预测内部部件。
image.png

URDFormer
https://d4wnnn.github.io/2026/07/19/Notion/URDFormer/
作者
D4wn
发布于
2026年7月19日
许可协议