Robitics 相关论文阅读

PIN-WM

Paper:PIN-WM: Learning Physics-INformed World Models for Non-Prehensile Manipulation,RSS 2025

目标:让机器人通过少量、与具体任务无关的真实交互,学习一个接近真实环境的世界模型。

Phase A:Real2Sim

  • 真实环境下,机械臂推动一下物体,得到推动后的 Image。
  • 仿真环境下,机械臂也推动一下物体,得到推动后的 Image。
  • 然后两个 Image 计算损失,反向传播更新物理参数。

Phase B:Sim2Real

  • 以 Phase A估计的物理参数为中心进行扰动,生成不同的仿真环境(提升鲁棒性)。
  • 在仿真环境下进行 PPO 学习。
  • 迁移到真实环境下执行相关操作。
image.png

AdaptiGraph

Paper:AdaptiGraph: Material-Adaptive Graph-Based Neural Dynamics for Robotic Manipulation

核心任务仍然是估计现实物体在“仿真训练得到的物理参数空间”中对应的参数值。

挑战:

  • 现实世界少量交互的数据,要想在仿真环境下拟合,通过贝叶斯优化耗时很长,可能需要900秒。

Phase A:

  • 在仿真环境下用不同的物理参数生成大量数据,并随机改变物理属性
  • 然后用图神经网络去模拟这个仿真环境。

Phase B:

  • 遇到现实的物体,提取点云,转换为粒子图。
  • 在现实中少量推动一下,得到推动后的粒子图。
  • 固定 GNN 权重,尝试不同的物理属性,比较预测点云和实际点云的 CD。
  • 通过 CMA-ES 优化搜索。
image.png

问题:既然已有仿真器,为什么还要再训练一个 GNN?

  • GNN 运行更快
  • 传统仿真求解器要求有完整的几何关系,粒子连接关系等

🎉ICWM

Paper:In-Context World Modeling for Robotic Control

论文核心:机器人到了一个陌生配置下,不要立刻干活,先安全地“动几下”,观察动作造成的视觉变化,从而在上下文中完成一次自动标定。

image.png

在执行任务前,先进行几次主动试探,记录如下信息:

  • 动作前图像
  • 执行动作
  • 执行后动作

然后把这些交互片段放到 Transformer 上下文。

OSCAR

Paper:OSCAR: Omni-Embodiment Action-Conditioned World Model for Robotics Page:https://wuzy2115.github.io/oscar-project-page/

image.png

核心 Motivation:

  • 传统训练方式是:机器人执行动作 → 看真实世界反馈 → 学习 ,效率低,且很昂贵。
  • 因此希望让 AI 学会机器人执行某个操作后,未来世界咋样。

Pipline:

  • 输入第一帧 RGB 图像 + 未来动作对应的骨架序列
  • 通过 Cosmos-Predict2.5-2B
  • 输出未来视频
image.png

TesserAct

Paper:TesserAct: Learning 4D Embodied World Models

Page:https://tesseractworld.github.io/

image.png

类似 OSCAR,也是一个 Embodied + World Models 的工作,但是世界表征从 Video 变成了 4D 场景

输入:

  • RGB 图
  • Depth 图
  • Normal 图
  • 文本 Prompt

然后首先输出未来的 RGB 视频 + Depth 视频 + Normal 视频

接着转成 4D点云,最后通过一个 MLP 映射动作。

image.png

Ego2Robot

Paper:Ego2Robot: Scalable Robot Data Synthesis from Egocentric Human Data

Page:

embed

image.png

核心:把人类第一视角操作视频转换成机器人模仿学习数据


Robitics 相关论文阅读
https://d4wnnn.github.io/2026/08/14/Notion/Robitics 相关论文阅读/
作者
D4wn
发布于
2026年8月14日
许可协议