\pi^3
Paper:
传统的端到端 3D 重建方法(如 DUSt3R、VGGT 等)通常需要指定某一个特定的图像作为参考视角(中心视角),并以此视角的相机坐标系作为全局坐标系来重建整个场景 。
这带来了一个致命的痛点:对初始视角的选择过于敏感 。如果选了一个较差的参考视角(例如模糊、遮挡严重或特征不明显的图像),整个场景的重建质量就会剧烈下降,导致系统极不稳定。
模型输入 N 张图(可以是连续的视频帧,也可以是无序的图像集)。
然后每张图独立进入一个 DNIOv2 骨干网络,抽取特征。
然后进行交替注意力机制(36 Blocks):
- 视角内自注意力: 只让同一张图内部的 Patches 进行自注意力。
- 全局跨图自注意力: 让所有图像的 Tokens 在全局范围内大杂烩式地交互,去寻找不同视角之间的匹配点和共视区域。
然后对于每张图,预测三个任务:
- 预测局部点图(Local Point Map
)模型为每张图像预测一个像素级对齐的 3D 点云 。注意: 此时这个点云是在这张图自己的相机坐标系下定义的 。 - 预测置信度图(Confidence Map
)模型会预估点云里每一个 3D 点的可靠程度(比如被遮挡的区域、纯色无特征的墙面,置信度就会低) 。 - 预测相机姿态(Camera Pose
)模型预测出每张图像对应的相机姿态 。因为没有全局原点,这时候预测出的姿态只是一个仿射不变空间下的中间变量 。
接下来是论文的核心创新:既然大家预测的都是局部结果,如何通过 Loss 让它们和 GT对齐并产生几何约束呢?
:深度加权, 是这个点距离相机的真实深度(距离) 。为什么要除以它呢?因为近处的物体看得清,预测更准,除以一个较小的 后权重就大;远处的物体(比如天边的云)本来就很难测准,除以一个很大的 后权重就小 。这能防止远处的脏数据带偏大局。
解决了点云的大小问题,接下来要解决相机位置(姿态)的监督
。因为没有全局坐标系,GT 给出的相机绝对位置(比如“相机在全局坐标系的
首先计算相对姿态:
假设模型预测了第
旋转不用考虑尺度,但是平移部分是有问题的。
是模型预测出的相对平移距离 。 是真实世界中(GT)两相机的相对平移距离 。 是 Huber Loss(一种对脏数据、噪点很鲁棒的误差计算函数) 。
\pi^3
https://d4wnnn.github.io/2026/04/18/Notion/pi^3/