Skip to main content
QUICK REVIEW

[论文解读] SemCal: Semantic LiDAR-Camera Calibration using Neural MutualInformation Estimator

Peng Jiang, Philip R. Osteen|arXiv (Cornell University)|Sep 21, 2021
Robotics and Sensor-Based Localization参考文献 37被引用 6
一句话总结

本文提出 SemCal,一种无需标定目标、全自动的激光雷达-相机标定方法,利用语义信息与神经互信息估计器(MINE)优化外参标定参数。通过将标定问题建模为基于语义标签互信息的可微分目标函数,并结合李群矩阵指数变换与基于核的采样方法,SemCal 实现了基于梯度的优化,在 KITTI360 和 RELLIS-3D 等真实世界数据集上实现了亚度量级的角误差与亚米级的平移误差,即使在使用预测语义标签的情况下亦表现优异。

ABSTRACT

This paper proposes SemCal: an automatic, targetless, extrinsic calibration algorithm for a LiDAR and camera system using semantic information. We leverage a neural information estimator to estimate the mutual information (MI) of semantic information extracted from each sensor measurement, facilitating semantic-level data association. By using a matrix exponential formulation of the $se(3)$ transformation and a kernel-based sampling method to sample from camera measurement based on LiDAR projected points, we can formulate the LiDAR-Camera calibration problem as a novel differentiable objective function that supports gradient-based optimization methods. We also introduce a semantic-based initial calibration method using 2D MI-based image registration and Perspective-n-Point (PnP) solver. To evaluate performance, we demonstrate the robustness of our method and quantitatively analyze the accuracy using a synthetic dataset. We also evaluate our algorithm qualitatively on an urban dataset (KITTI360) and an off-road dataset (RELLIS-3D) benchmark datasets using both hand-annotated ground truth labels as well as labels predicted by the state-of-the-art deep learning models, showing improvement over recent comparable calibration approaches.

研究动机与目标

  • 开发一种无需物理标定目标或人工初始化的无标定目标、全自动激光雷达-相机外参标定方法。
  • 通过利用双传感器的语义信息,提升标定的鲁棒性与精度,实现超越边缘或梯度等低级特征的高层数据关联。
  • 基于语义标签之间的互信息,构建完全可微分的目标函数,支持通过梯度下降实现端到端优化。
  • 提出一种基于语义的初始化方法,结合基于2D互信息的图像配准与PnP算法,提升收敛性并降低对初始估计的依赖。
  • 在合成数据集与真实世界数据集(KITTI360、RELLIS-3D)上评估性能,使用真实标签与深度学习预测的语义标签,验证方法的泛化性与鲁棒性。

提出的方法

  • 使用神经互信息估计器(MINE)估计激光雷达与相机密集语义标签之间的互信息(MI),替代基于原始传感器强度的MI估计。
  • 通过使用 se(3) 的矩阵指数参数化方法建模变换,将激光雷达-相机标定问题转化为可微分目标函数,支持梯度计算。
  • 采用基于核的采样方法,将激光雷达点投影到相机图像平面,并采样对应的图像特征,实现跨模态特征对齐。
  • 实施两阶段流程:首先,利用基于2D互信息的图像配准与PnP生成初始标定估计;其次,通过梯度优化语义MI目标函数进行精修。
  • 利用基于深度学习的语义分割模型(如 HRNet+OCR、SalsaNext)生成语义标签,并将其作为MI估计与优化流程的输入。
  • 使用标准梯度下降框架(如 PyTorch)优化标定参数,支持与现代深度学习库的无缝集成。

实验结果

研究问题

  • RQ1激光雷达与相机的语义标签之间的互信息能否有效驱动外参的可微分、基于梯度的优化?
  • RQ2在真实世界与标签噪声条件下,基于语义的标定方法相较于基于强度的MI方法以及SOTA方法(如SOIC)的性能表现如何?
  • RQ3所提方法在无需标定目标或人工初始化的情况下,能达到多高的标定精度?其对深度学习模型产生的标签噪声的鲁棒性如何?
  • RQ4相较于传统基于特征或强度的方法,使用语义级数据关联是否能提升标定精度与收敛稳定性?
  • RQ5当使用SOTA模型预测的语义标签而非真实标注时,该方法能否保持高精度?

主要发现

  • 在 KITTI360 数据集上使用真实标签时,SemCal 实现了 0.14° 的滚转误差、0.17° 的俯仰误差、0.13° 的偏航误差,平移误差控制在 0.15 米以内,展现出极高的精度。
  • 在 RELLIS-3D 数据集上使用真实标签时,SemCal 实现了 0.56° 的滚转误差、0.15° 的俯仰误差、0.74° 的偏航误差,平移误差控制在 0.13 米以内,表明其在非铺装路面环境中的强大性能。
  • 当使用深度学习模型(HRNet+OCR 与 SalsaNext)预测的语义标签时,SemCal 仍保持较低误差:角度误差在 1° 以内,平移误差在 0.4 米以内,表明对标签噪声具有强鲁棒性。
  • 与基线方法相比,SemCal 在 KITTI360 与 RELLIS-3D 上均优于 SOIC 与 PMI 变体(Pandey 方法结合 MINE),其标定参数更接近真实值。
  • 视觉结果表明,SemCal 的跨传感器数据融合效果优于 SOIC 与 PMI,其中 PMI 因天空与草地的强度混淆导致明显的 z 轴错位。
  • 该方法在 156 秒内完成标定(含 30 秒初始化),虽非实时,但适用于在线后台标定。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。