[论文解读] DSAC - Differentiable RANSAC for Camera Localization
本文提出 DSAC,一种可微分的 RANSAC 变体,可实现用于相机定位的深度学习流水线的端到端训练。通过用概率性、可微分的假设选择过程替代 RANSAC 的硬性假设选择,DSAC 允许反向传播通过鲁棒估计步骤,从而在 7-Scenes 数据集上相比最先进方法实现了 7.3% 的准确率提升。
RANSAC is an important algorithm in robust optimization and a central building block for many computer vision applications. In recent years, traditionally hand-crafted pipelines have been replaced by deep learning pipelines, which can be trained in an end-to-end fashion. However, RANSAC has so far not been used as part of such deep learning pipelines, because its hypothesis selection procedure is non-differentiable. In this work, we present two different ways to overcome this limitation. The most promising approach is inspired by reinforcement learning, namely to replace the deterministic hypothesis selection by a probabilistic selection for which we can derive the expected loss w.r.t. to all learnable parameters. We call this approach DSAC, the differentiable counterpart of RANSAC. We apply DSAC to the problem of camera localization, where deep learning has so far failed to improve on traditional approaches. We demonstrate that by directly minimizing the expected loss of the output camera poses, robustly estimated by RANSAC, we achieve an increase in accuracy. In the future, any deep learning pipeline can use DSAC as a robust optimization component.
研究动机与目标
- 使包含 RANSAC 作为鲁棒估计组件的深度学习流水线能够实现端到端训练,而该组件传统上不具备可微性。
- 克服 RANSAC 假设选择(argmax)的不可微性,以支持基于梯度的优化。
- 开发一种可微分的 RANSAC 变体,既保留 RANSAC 的硬性选择行为,又能实现梯度传播。
- 通过可微分优化直接最小化 RANSAC 估计位姿的期望损失,从而提升相机定位的准确性。
- 证明概率性假设选择相较于软 argmax 在避免过拟合和保持鲁棒性方面的优越性。
提出的方法
- 提出两种可微分 RANSAC 变体:软 argmax(假设的加权平均)和概率选择(带可微采样的硬选择)。
- 提出 DSAC,一种可微分 RANSAC,将假设选择视为具有可学习假设概率分布的随机过程。
- 使用类似策略梯度的反向传播方法,计算期望损失相对于网络权重的梯度,从而实现端到端训练。
- 采用双流卷积神经网络架构:一个用于预测场景坐标,另一个用于评分假设,二者通过 DSAC 关联。
- 利用重参数化技巧和对数导数技巧推导梯度,关键方程包括期望损失和概率梯度(公式 13–14)。
- 将该方法应用于相机定位任务,使用场景坐标回归森林,以 DSAC 取代传统 RANSAC 进行位姿估计。
实验结果
研究问题
- RQ1RANSAC 能否被设计为可微分,以实现包含 RANSAC 的深度学习流水线的端到端训练?
- RQ2DSAC 中的概率性假设选择是否在保持传统 RANSAC 鲁棒性的同时,支持基于梯度的优化?
- RQ3与基于软 argmax 的可微分 RANSAC 相比,DSAC 在泛化能力和鲁棒性方面表现如何?
- RQ4DSAC 能否通过直接最小化位姿估计的期望损失来提升相机定位的准确性?
- RQ5在具有纹理缺失表面、运动模糊和重复结构等挑战性真实场景条件下,DSAC 是否仍能保持性能?
主要发现
- 在 7-Scenes 数据集上,DSAC 相比最先进方法实现了 7.3% 的准确率提升,超越了以往的相机定位方法。
- DSAC 的概率选择变体优于软 argmax 方法,表现出更低的过拟合和更好的泛化能力。
- 即使内点比例低至 5%,DSAC 仍能保持高准确率,证明其对噪声或稀疏预测的鲁棒性。
- 该方法成功处理了具有挑战性的场景,如纹理缺失表面、运动模糊、反光和重复结构,在所有情况下均正确估计了相机位姿。
- 纠正相机位姿评估错误(使用逆位姿计算误差)后,准确率修正为 45.5%,通过切换到标准的迭代 PnP 算法,性能得到显著提升。
- 采用迭代 PnP 算法而非原始实现,是实现最终报告性能提升的主要因素。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。