EmbodiedGen

Paper:EmbodiedGen: Towards a Generative 3D World Engine for Embodied Intelligence

现在很多的 3D 生成方法都是难以仿真,比如没有真实尺寸,没有质量等物理属性。

论文的核心有4个部分:

image.png

整体流程如上,可以分成3个部分

Scene Designer

负责任务与场景设计。

输入可以是:

  • 一张真实场景图片;
  • 一段任务描述,例如“机械臂抓取鞋子”;
  • 指定机器人、背景、桌子、目标物体和干扰物体。

系统利用视觉语言模型识别或规划:

  • 哪些物体需要生成;
  • 哪些物体可交互;
  • 场景中应该放置什么;
  • 各物体应该如何布局。

Assets Generator

负责生成:

  • 刚性物体;
  • 铰接物体;
  • 纹理;
  • 室内背景场景。

具体有下面几种:

  • Image-to-3D,基于 Trellis,但是不直接采用 Trellis 的输出,而是增加了完整的后处理流程。
    • 自动质量检查,检查失败后,会更换分割模型,或者随机种子等重新生成。
      • AestheticChecker:检查纹理和视觉质量;
      • ImageSegChecker:检查前景分割是否截断物体;
      • MeshGeoChecker:检查几何是否完整、合理。
    • 物理属性恢复。
      • 使用 GPT-4o 和 Qwen 构建“物理专家”模块,根据多视图渲染和文字语义估计:真实高度,整体尺寸,质量,摩擦系数,物体类别,文字描述。
      • 之后统一缩放mesh 和 3DGS,并输出 URDF。
  • Text-to-3D,首先使用 Kolors 生成图片,然后再调用 Image-to-3D > Kolors 是什么?是快手开源的文生图模型。
  • Articulated Object Generation 铰接体生成,使用已有方法 DIPO, 输入物体的两个状态,即静止状态还有运动后的状态图片。 > DIPO 是什么?
    > 全称:Dual-state Images controlled articulated object generation
    > 根据物体运动前后的两张图,生成带部件划分,连接关系和关节运动的 3D 铰接体。
  • Texture Generation 可控纹理生成,提出了一个叫 GeoLifter 的轻量模块。
    • 输入 Mesh + 文本(可选的风格参考图片),系统从6个视角渲染 normal map,position map,mask,系统将这些几何条件注入到 Kolors 扩散模型,生成 6 视图一致的纹理。
image.png

Scene Composer

把生成的物体、背景、机器人和布局组合起来,构建:

  • digital twin;
  • 交互式仿真场景;
  • 机器人操作和导航任务。

EmbodiedGen
https://d4wnnn.github.io/2026/08/08/Notion/EmbodiedGen/
作者
D4wn
发布于
2026年8月8日
许可协议