[论文解读] Extreme Relative Pose Estimation for RGB-D Scans via Scene Completion
该论文提出了一种深度学习框架,通过在场景补全和位姿估计之间迭代交替,实现在重叠极少或完全无重叠的RGB-D扫描之间进行极端相对位姿估计。通过利用循环网络中的几何和语义先验,该方法实现了最先进性能,包括在SUNCG、Matterport和ScanNet数据集上对非重叠扫描实现有意义的位姿估计,其平均旋转误差分别为79.9°、87.9°和81.8°。
Estimating the relative rigid pose between two RGB-D scans of the same underlying environment is a fundamental problem in computer vision, robotics, and computer graphics. Most existing approaches allow only limited maximum relative pose changes since they require considerable overlap between the input scans. We introduce a novel deep neural network that extends the scope to extreme relative poses, with little or even no overlap between the input scans. The key idea is to infer more complete scene information about the underlying environment and match on the completed scans. In particular, instead of only performing scene completion from each individual scan, our approach alternates between relative pose estimation and scene completion. This allows us to perform scene completion by utilizing information from both input scans at late iterations, resulting in better results for both scene completion and relative pose estimation. Experimental results on benchmark datasets show that our approach leads to considerable improvements over state-of-the-art approaches for relative pose estimation. In particular, our approach provides encouraging relative pose estimates even between non-overlapping scans.
研究动机与目标
- 解决RGB-D扫描之间重叠极少或完全无重叠时的相对位姿估计挑战,传统基于特征的方法因对应点不足而失效。
- 通过引入基于场景补全的方法,克服现有方法对扫描重叠量较大的限制,以推断缺失的几何结构。
- 通过利用结构先验和双向扫描补全,提升极端位姿场景下的位姿估计精度。
- 证明位姿估计与场景补全之间的迭代优化优于单次通过或非迭代方法。
- 实现SLAM回环检测、稀疏视图下的3D重建以及使用不完整扫描进行拼图游戏等实际应用。
提出的方法
- 引入一种循环神经网络,通过在相对位姿估计模块与双向扫描补全过程之间交替,迭代优化场景补全与位姿估计结果。
- 使用结合深度图、法向量和语义描述符的多模态丰富表示,以提升补全质量与匹配鲁棒性。
- 设计一种新型成对匹配模块,集成谱匹配与基于RANSAC的鲁棒拟合,以处理噪声或不完整的预测结果。
- 通过将当前位姿估计结果应用于一个扫描,并将其与另一扫描融合,实现双向扫描补全。
- 通过补全监督来监督相对位姿网络,利用补全后的场景作为真实几何的代理,以提升泛化能力。
- 使用可微分损失函数联合训练端到端网络,该损失函数结合补全与位姿估计目标,实现联合优化。
实验结果
研究问题
- RQ1在重叠极少或无重叠的扫描中,场景补全是否能显著提升极端位姿场景下的相对位姿估计性能?
- RQ2位姿估计与场景补全之间的迭代、循环优化过程是否优于单次通过或非迭代方法?
- RQ3所提方法在传统特征匹配失效的非重叠RGB-D扫描中,估计相对位姿的性能如何?
- RQ4几何与语义先验在不完整扫描设置下,对提升补全与位姿估计精度的贡献程度如何?
- RQ5谱匹配与鲁棒拟合的结合在存在噪声或不完整预测时,对性能的提升效果如何?
主要发现
- 对于重叠超过10%的扫描,该方法将SUNCG上的平均旋转误差从36.6°降低至12.0°,Matterport从42.0°降至9.0°,ScanNet从51.4°降至30.2°。
- 对于非重叠扫描,该方法在SUNCG、Matterport和ScanNet上的平均旋转误差分别为79.9°、87.9°和81.8°,显著优于预期的随机误差126.3°。
- 消融实验表明,即使在重叠扫描中移除扫描补全部分也会导致性能显著下降,证明其必要性。
- 移除循环模块后,所有数据集上的性能均下降,表明迭代优化对准确的位姿与补全结果至关重要。
- 旋转估计误差分布集中在90°和180°附近,表明室内场景的对称性导致模糊性,这是可预期且可管理的。
- 补全质量随与观测区域距离增加而下降,但该影响通过迭代优化得到缓解,尤其在小重叠扫描中受益显著。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。