[论文解读] RelPose: Predicting Probabilistic Relative Rotation for Single Objects in the Wild
该论文提出 RelPose,一种自上而下的基于能量的模型,用于预测野外单个物体图像之间的概率性相对旋转,从而实现从稀疏视图中鲁棒地估计相机位姿。通过使用基于能量的神经网络对相对旋转建模多模态分布,并优化联合似然,该方法在稀疏数据上优于 SfM 和 SLAM 基线,并能泛化到未见类别,实现仅需最少输入即可进行一致的多视图重建。
We describe a data-driven method for inferring the camera viewpoints given multiple images of an arbitrary object. This task is a core component of classic geometric pipelines such as SfM and SLAM, and also serves as a vital pre-processing requirement for contemporary neural approaches (e.g. NeRF) to object reconstruction and view synthesis. In contrast to existing correspondence-driven methods that do not perform well given sparse views, we propose a top-down prediction based approach for estimating camera viewpoints. Our key technical insight is the use of an energy-based formulation for representing distributions over relative camera rotations, thus allowing us to explicitly represent multiple camera modes arising from object symmetries or views. Leveraging these relative predictions, we jointly estimate a consistent set of camera rotations from multiple images. We show that our approach outperforms state-of-the-art SfM and SLAM methods given sparse images on both seen and unseen categories. Further, our probabilistic approach significantly outperforms directly regressing relative poses, suggesting that modeling multimodality is important for coherent joint reconstruction. We demonstrate that our system can be a stepping stone toward in-the-wild reconstruction from multi-view datasets. The project page with code and videos can be found at https://jasonyzhang.com/relpose.
研究动机与目标
- 为解决在真实世界场景中,从通用物体的稀疏、无位姿图像中估计准确相机视角的挑战。
- 克服基于对应关系的 SfM 和 SLAM 方法在稀疏、低重叠图像条件下失效的局限性。
- 通过学习相对相机位姿而无需依赖物体的规范位姿,实现从少量图像中鲁棒地进行多视图三维重建。
- 通过概率建模,对由于物体对称性或模糊视角导致的相对旋转中的不确定性与多模态性进行建模。
- 为需要相机位姿的神经三维重建方法提供可扩展、可泛化的初始化方案。
提出的方法
- 该方法使用基于能量的神经网络,为图像对之间的候选相对旋转预测未归一化的对数概率(能量),从而实现对位姿歧义的概率建模。
- 相对旋转在视图对齐的坐标系中计算,避免对物体中心规范位姿的依赖,提升泛化能力。
- 通过最大化基于成对能量预测推导出的联合似然,联合优化多张图像中的相机位姿。
- 采用带有抗混叠和旋转矩阵位置编码的 ResNet-50,提取图像与旋转特征,并通过多层感知机(MLP)融合以预测能量分数。
- 该方法通过学习多模态分布显式建模相对旋转中的多个模式(例如,对 90° 对称物体建模 4 个模式),与直接回归不同。
- 该方法假设物体正对视角来初始化平移,并利用旋转一致性来启动稀疏视图重建。
实验结果
研究问题
- RQ1在从稀疏、低重叠图像中估计相机位姿时,数据驱动的自上而下方法是否能优于基于对应关系的 SfM 和 SLAM 方法?
- RQ2将相对旋转建模为概率性多模态分布,是否相比直接回归能显著提升联合位姿的一致性?
- RQ3该方法能否泛化到训练过程中未见过的新物体类别,尤其是具有对称性或复杂外观的物体?
- RQ4该系统在传统 SfM 假设失效的形变或非刚性物体上表现如何?
- RQ5基于能量的建模在存在歧义或低纹理视图时,能在多大程度上实现鲁棒推理?
主要发现
- RelPose 在稀疏图像集上优于最先进 SfM 和 SLAM 方法(如 DROID-SLAM、COLMAP),尤其在图像数量低于 20 张时表现更优。
- 该方法能泛化到未见物体类别,在训练数据中未包含的类别的新实例上仍表现出色。
- 通过基于能量的学习建模多模态相对旋转,相比直接回归,能显著提升联合相机位姿估计的一致性。
- 系统成功捕捉了旋转对称性——例如,对矩形物体预测出 4 个模式,对对称水杯预测出 2 个模式——展示了对歧义的鲁棒性。
- 即使在猫或沙发等形变物体上,该方法仍能生成合理且一致的相对旋转预测,表明其对外观变化具有强鲁棒性。
- 定性结果表明,该方法能正确识别对称模式,并在模糊情况下(如仅可见水杯把手)避免错误地预测单一模式。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。