[论文解读] Degeneracy in Self-Calibration Revisited and a Deep Learning Solution for Uncalibrated SLAM
本文重新审视了在两视角自标定中径向畸变的几何退化问题,并提出了一种基于深度学习的单图像相机自标定方法,采用带有深度监督的卷积神经网络(CNN)。该模型在合成数据上进行训练,可在未标定的 KITTI Raw 和 YouTube 视频中实现鲁棒的无检查棋盘SLAM,定量评估显示其轨迹误差接近真实值,误差差距微小。
Self-calibration of camera intrinsics and radial distortion has a long history of research in the computer vision community. However, it remains rare to see real applications of such techniques to modern Simultaneous Localization And Mapping (SLAM) systems, especially in driving scenarios. In this paper, we revisit the geometric approach to this problem, and provide a theoretical proof that explicitly shows the ambiguity between radial distortion and scene depth when two-view geometry is used to self-calibrate the radial distortion. In view of such geometric degeneracy, we propose a learning approach that trains a convolutional neural network (CNN) on a large amount of synthetic data. We demonstrate the utility of our proposed method by applying it as a checkerboard-free calibration tool for SLAM, achieving comparable or superior performance to previous learning and hand-crafted methods.
研究动机与目标
- 通过通用畸变模型和离散SfM公式化,理论证明在前向运动下两视角径向畸变自标定的退化性。
- 解决在真实驾驶场景中,前向运动导致径向畸变与场景深度之间产生歧义时,几何方法的不稳定性问题。
- 开发一种数据驱动方法,从单张未标定图像中学习相机内参和径向畸变参数,实现无需检查棋盘的鲁棒SLAM。
- 在KITTI Raw和YouTube的真实世界视频序列上,展示所提方法在未标定SLAM中的可行性和优越性。
- 证明在CNN中采用深度监督可提升单图像相机自标定在内参和畸变参数估计方面的性能,优于标准多任务学习。
提出的方法
- 使用通用畸变模型和离散结构从运动(SfM)公式化,正式证明在前向运动下两视角径向畸变自标定的退化性。
- 通过随机改变相机内参并为标定图像施加随机径向畸变,生成大规模合成数据集,以模拟多样的真实世界条件。
- 训练一个带有深度监督的卷积神经网络(CNN),从单张未标定图像中预测相机内参(焦距、主点)和径向畸变参数。
- 在CNN的中间层应用深度监督,以增强正则化效果并提高径向畸变与内参参数估计的准确性。
- 采用两步SLAM流程:首先,网络从前100帧中估计相机参数;其次,利用这些参数对整个视频序列进行标定,再输入ORB-SLAM。
- 在KITTI Raw和YouTube数据集上评估该方法,以ORB-SLAM使用真实参数和人工设计方法作为基线。
实验结果
研究问题
- RQ1在前向运动下,两视角径向畸变自标定退化问题的理论成因是什么?如何进行形式化证明?
- RQ2径向畸变与场景深度之间的歧义如何影响几何自标定方法在驾驶场景中的稳定性?
- RQ3在合成数据上训练的深度学习模型能否泛化到真实世界的未标定视频,并优于传统几何方法和人工设计方法?
- RQ4在CNN中采用深度监督是否能提升单图像相机自标定在径向畸变和内参参数估计方面的准确性?
- RQ5是否可行通过所提自标定方法在无需检查棋盘的情况下实现对未标定视频的鲁棒SLAM?
主要发现
- 本文提供了形式化的理论证明,表明在前向运动下,由于径向畸变与场景深度之间存在固有歧义,两视角径向畸变自标定存在退化现象。
- 所提CNN方法在KITTI Raw测试序列的全部关键帧轨迹估计中,实现了8.04米的中位数均方根误差(RMSE),非常接近真实值的7.29米RMSE。
- 尽管人工设计方法('HandCrafted+OVP')在KITTI Raw序列的ORB-SLAM五次运行中全部失败,所提方法仍成功实现了无显著漂移的SLAM运行。
- 在YouTube测试序列中,所提方法成功使ORB-SLAM在全部三个序列上运行,而人工设计方法因初始化失败在最后两个序列中全部失败。
- 定性结果表明,使用所提方法重建的场景结构和相机轨迹明显比人工设计基线方法更准确、畸变更小。
- 该方法在真实世界未标定视频上表现出良好的泛化能力,表明CNN中的深度监督可使内参和畸变估计性能优于标准多任务学习。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。