Robitics 相关论文阅读
PIN-WM
Paper:PIN-WM: Learning Physics-INformed World Models for Non-Prehensile Manipulation,RSS 2025
目标:让机器人通过少量、与具体任务无关的真实交互,学习一个接近真实环境的世界模型。
Phase A:Real2Sim
- 真实环境下,机械臂推动一下物体,得到推动后的 Image。
- 仿真环境下,机械臂也推动一下物体,得到推动后的 Image。
- 然后两个 Image 计算损失,反向传播更新物理参数。
Phase B:Sim2Real
- 以 Phase A估计的物理参数为中心进行扰动,生成不同的仿真环境(提升鲁棒性)。
- 在仿真环境下进行 PPO 学习。
- 迁移到真实环境下执行相关操作。
AdaptiGraph
Paper:AdaptiGraph: Material-Adaptive Graph-Based Neural Dynamics for Robotic Manipulation
核心任务仍然是估计现实物体在“仿真训练得到的物理参数空间”中对应的参数值。
挑战:
- 现实世界少量交互的数据,要想在仿真环境下拟合,通过贝叶斯优化耗时很长,可能需要900秒。
Phase A:
- 在仿真环境下用不同的物理参数生成大量数据,并随机改变物理属性
- 然后用图神经网络去模拟这个仿真环境。
Phase B:
- 遇到现实的物体,提取点云,转换为粒子图。
- 在现实中少量推动一下,得到推动后的粒子图。
- 固定 GNN 权重,尝试不同的物理属性,比较预测点云和实际点云的 CD。
- 通过 CMA-ES 优化搜索。
问题:既然已有仿真器,为什么还要再训练一个 GNN?
- GNN 运行更快
- 传统仿真求解器要求有完整的几何关系,粒子连接关系等
🎉ICWM
Paper:In-Context World Modeling for Robotic Control
论文核心:机器人到了一个陌生配置下,不要立刻干活,先安全地“动几下”,观察动作造成的视觉变化,从而在上下文中完成一次自动标定。
在执行任务前,先进行几次主动试探,记录如下信息:
- 动作前图像
- 执行动作
- 执行后动作
然后把这些交互片段放到 Transformer 上下文。
OSCAR
Paper:OSCAR: Omni-Embodiment Action-Conditioned World Model for Robotics Page:https://wuzy2115.github.io/oscar-project-page/
核心 Motivation:
- 传统训练方式是:
机器人执行动作 → 看真实世界反馈 → 学习,效率低,且很昂贵。 - 因此希望让 AI 学会机器人执行某个操作后,未来世界咋样。
Pipline:
- 输入第一帧 RGB 图像 + 未来动作对应的骨架序列
- 通过 Cosmos-Predict2.5-2B
- 输出未来视频
TesserAct
Paper:TesserAct: Learning 4D Embodied World Models
Page:https://tesseractworld.github.io/
类似 OSCAR,也是一个 Embodied + World Models 的工作,但是世界表征从 Video 变成了 4D 场景
输入:
- RGB 图
- Depth 图
- Normal 图
- 文本 Prompt
然后首先输出未来的 RGB 视频 + Depth 视频 + Normal 视频
接着转成 4D点云,最后通过一个 MLP 映射动作。
Ego2Robot
Paper:Ego2Robot: Scalable Robot Data Synthesis from Egocentric Human Data
Page:
核心:把人类第一视角操作视频转换成机器人模仿学习数据