Robot 抓取位姿估计路线
机器人抓取位姿估计技术路线梳理
机器人抓取位姿估计的目标是:
输入 RGB-D 图像或场景点云,预测夹爪应该放在哪里、朝向哪个方向、旋转多少,以及张开多宽。
对于平行夹爪,最终通常输出:
其中:
:夹爪旋转; :夹爪位置; :夹爪宽度。
目前的方法可以大致分为下面几条技术路线。
一、判别式抓取位姿预测
Paper:AnyGrasp: Robust and Efficient Grasp Perception in Spatial and Temporal Domains
论文核心:给机器人一帧 RGB-D 相机得到的点云,直接生成大量“夹爪应该从哪里、以什么角度、张开多宽去抓”的候选姿态;如果物体在运动,还能在连续帧之间追踪同一个抓取位置。
AnyGrasp 的几何模块建立在 GSNet 上。
主要流程:
- 输入场景点云。
- 判断哪些点适合作为抓取中心。
3D 网络先给每个点预测:
- 是否属于物体;
- 这个点附近是否容易抓,即 graspness。
然后从高 graspness 区域中采样 1024 个种子点,称为 Graspable FPS。
- 对每个种子点预测接近方向。
网络对每个种子点预测 300 个方向的分数,然后选择比较合适的靠近方向。
例如:
- 从上向下抓;
- 从侧面抓;
- 斜着抓。
- 预测夹爪旋转角度。
确定接近方向后,还需要预测夹爪绕接近方向旋转多少。论文将旋转离散为 12 个角度。
- 预测接近深度和夹爪宽度。
网络预测夹爪沿接近方向深入多少,以及夹爪需要张开多宽。
最后将这些结果组合成完整的抓取位姿:
这类方法的特点是:
- 推理速度快;
- 一次可以生成大量候选;
- 适合直接从点云预测;
- 工程上比较成熟。
不足是方向、角度和深度通常是离散的,而且单视角点云看不到物体背面的结构。
二、生成式抓取位姿预测
Paper:
- GraspGen: A Diffusion-based Framework for 6-DOF Grasping with On-Generator Training
- GraspGen-X: Cross-Embodiment 6-DOF Diffusion-based Grasping
这类方法不再把抓取分解成“点、方向、角度、深度”逐步分类,而是直接学习抓取位姿的分布。
论文核心:
输入物体或场景点云,通过扩散模型生成多组不同的 6-DoF 抓取姿态。
主要流程:
- 输入场景点云。
- 随机初始化一批抓取位姿。
- 使用扩散模型不断去噪。
- 得到多组完整的抓取候选。
- 使用判别器、碰撞检测或物理模型对候选重新打分。
和 AnyGrasp 相比:
1 | |
这类方法的优点是:
- 可以自然生成多种不同抓法;
- 不完全受固定角度和方向限制;
- 更适合表示一个物体的多模态抓取分布。
不足是扩散模型通常需要多次去噪,推理和训练更加复杂。
三、三维补全和多视角抓取
Paper:ZeroGrasp: Zero-Shot Shape Reconstruction Enabled Robotic Grasping
单视角 RGB-D 相机只能看到物体的一部分。
例如,相机只能看到杯子的正面,但夹爪抓取时还需要知道:
- 杯子的背面在哪里;
- 另一根手指是否能够接触;
- 夹爪是否会撞到隐藏部分。
ZeroGrasp 的核心思路是:
先根据部分观测推测更加完整的三维几何,再在完整几何上生成抓取位姿。
主要流程:
- 输入 RGB-D 图像或部分点云。
- 推测被遮挡的物体结构。
- 得到更加完整的三维表示。
- 根据完整几何生成抓取姿态。
另一种方法是使用多个相机:
1 | |
这类方法适合:
- 物体严重遮挡;
- 杂乱堆叠场景;
- 杯子、碗等背面结构比较重要的物体;
- 侧面抓取。
不足是需要额外的重建计算,或者需要多个相机。