[论文解读] Calibrating LiDAR and Camera using Semantic Mutual information
该论文提出了一种无需标定目标、自动化的激光雷达-相机外参标定方法,通过基于互信息神经估计(MINE)和矩阵指数变换的可微分框架,最大化传感器模态之间的语义互信息。该方法在 KITTI360 和 RELLIS-3D 基准测试中实现了最先进水平的精度,优于以往基于学习和基于优化的方法,其优势在于采用完全可微分、具备语义感知能力的优化策略,并通过梯度下降实现优化。
We propose an algorithm for automatic, targetless, extrinsic calibration of a LiDAR and camera system using semantic information. We achieve this goal by maximizing mutual information (MI) of semantic information between sensors, leveraging a neural network to estimate semantic mutual information, and matrix exponential for calibration computation. Using kernel-based sampling to sample data from camera measurement based on LiDAR projected points, we formulate the problem as a novel differentiable objective function which supports the use of gradient-based optimization methods. We also introduce an initial calibration method using 2D MI-based image registration. Finally, we demonstrate the robustness of our method and quantitatively analyze the accuracy on a synthetic dataset and also evaluate our algorithm qualitatively on KITTI360 and RELLIS-3D benchmark datasets, showing improvement over recent comparable approaches.
研究动机与目标
- 开发一种无需标定目标或精确初始猜测的、无需标定目标的激光雷达与相机系统外参自动标定方法。
- 通过利用来自两种传感器的语义信息,而非依赖边缘或梯度等低层次特征,来提升标定精度。
- 通过将互信息作为可微分的目标函数,实现标定过程的端到端可微分优化。
- 在合成数据集和真实世界数据集(包括 KITTI360 和 RELLIS-3D)上,验证方法在标签噪声和数据量变化条件下的鲁棒性与精度。
- 提供一种与深度学习库兼容的框架,可集成到更广泛的传感器融合流水线中。
提出的方法
- 该方法将激光点云与相机图像之间的语义标签互信息(MI)作为优化目标,替代传统的几何或强度度量。
- 使用 MINE(互信息神经估计器)估计语义互信息,实现可微分的互信息估计,以支持基于梯度的优化。
- 采用基于核的采样模块,将投影到图像上的激光点对应像素进行采样,实现三维点云投影点与二维图像区域的空间对齐,以支持联合语义比较。
- 通过反对称矩阵的矩阵指数对变换矩阵进行参数化,确保在优化过程中满足 SO(3) 和 SE(3) 群约束。
- 通过基于 2D 互信息的图像配准方法,对投影后的激光标签与图像标签进行初始标定,以提供鲁棒的起始点。
- 整个流程完全可微分,并使用 PyTorch 或类似深度学习框架通过随机梯度下降进行优化。
实验结果
研究问题
- RQ1语义互信息能否作为无需标定目标的激光雷达-相机标定的鲁棒且可微分的目标函数?
- RQ2基于 MINE 和矩阵指数的可微分框架相较于不可微分或非语义方法,在标定精度方面有何提升?
- RQ3标签噪声或数据量在多大程度上影响基于语义 MI 的标定性能?
- RQ4该方法是否能在无需真实初始值的情况下,在 KITTI360 和 RELLIS-3D 等真实世界基准上实现具有竞争力的标定精度?
- RQ5与 SOIC 和 PMI 等最先进方法相比,该方法在对齐质量与鲁棒性方面表现如何?
主要发现
- 在合成的 Carla 数据集上,随着帧数增加,标定误差方差减小,表明更多数据可提升 MI 估计的稳定性和收敛性。
- 在 KITTI360 上,该方法获得横滚角 73.98°、俯仰角 -71.18°、偏航角 64.57°,平移量为 (0.02, -0.14, -1.36) m,与数据集提供的参数高度一致。
- 在 RELLIS-3D 上,该方法获得横滚角 70.24°、俯仰角 67.63°、偏航角 -67.32°,平移量为 (-0.05, -0.19, -0.06) m,在对齐质量上优于 SOIC 和 PMI。
- 在 20% 标签噪声条件下,方法的误差方差有所增加,但仍保持合理精度,表明对中等程度语义标签错误具有鲁棒性。
- 在 KITTI360 和 RELLIS-3D 上的可视化对比显示,与 SOIC 和 PMI 相比,该方法在复杂城市场景中表现出更优的跨传感器对齐效果。
- 该方法在两个基准测试中均达到最先进水平,其标定结果最接近提供的数据集参数,验证了其有效性和鲁棒性。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。