URDFormer
Paper:URDFormer: A Pipeline for Constructing Articulated Simulation Environments from Real-World Images
作者发现真实的 Image → URDF 训练数据十分稀缺,因此采用了一个很好的思路
先从已知 URDF 生成逼真的图片,再把这个过程反过来训练。
具体步骤如下:
- 首先程序化生成一个仿真场景 z
- 随后在模拟器中渲染出比较粗糙的图片,再利用 Stable Diffusion 等图像生成模型,把粗糙渲染转换成逼真的 RGB 图片。
在推理时,给模型一张真实的照片,首先模型用 GroundingDINO 检测物体框/部件框,然后URDFormer 预测每个框的类别,空间信息,父子关系。最后组合成 URDF。
为什么分成 Global 和 Part 两个模型?
作者没有直接用一个模型同时预测整个厨房和所有细粒度部件,而是拆成两级。
- Global:预测场景结构
- 输入整个厨房的照片以及高层的物体框,主要预测每个大物体的位置和尺寸,父子关系,大物体挂在哪面墙上。
- Part:预测物体内部结构。
- 再裁剪出一个具体的物体,比如柜子,然后预测内部部件。