[论文解读] LCCNet: LiDAR and Camera Self-Calibration using Cost Volume Network
LCCNet 是一种用于在线 LiDAR-相机自标定的端到端深度学习框架,通过代价体层建模 RGB 图像与深度图像之间的跨传感器特征相关性。在较大的标定偏差范围内(±1.5m,±20°),其平移误差均值为 0.297 cm,旋转误差均值为 0.017°,优于现有最先进学习方法,在单张 GPU 上实现每轮 24ms 的实时推理。
In this paper, we propose a novel online self-calibration approach for Light Detection and Ranging (LiDAR) and camera sensors. Compared to the previous CNN-based methods that concatenate the feature maps of the RGB image and decalibrated depth image, we exploit the cost volume inspired by the PWC-Net for feature matching. Besides the smooth L1-Loss of the predicted extrinsic calibration parameters, an additional point cloud loss is applied. Instead of regress the extrinsic parameters between LiDAR and camera directly, we predict the decalibrated deviation from initial calibration to the ground truth. During inference, the calibration error decreases further with the usage of iterative refinement and the temporal filtering approach. The evaluation results on the KITTI dataset illustrate that our approach outperforms CNN-based state-of-the-art methods in terms of a mean absolute calibration error of 0.297cm in translation and 0.017° in rotation with miscalibration magnitudes of up to 1.5m and 20°.
研究动机与目标
- 为解决人工标记法 LiDAR-相机标定的局限性,该方法耗时长且不适用于实际部署。
- 开发一种在线自标定方法,在自动驾驶车辆运行过程中传感器发生漂移时仍能保持高精度。
- 通过显式建模跨传感器特征相关性,提升现有基于学习方法的标定精度与鲁棒性。
- 实现实时推理并保持低延迟,适用于动态自动驾驶环境中的部署。
提出的方法
- LCCNet 采用三部分架构:特征提取网络、用于匹配 RGB 与深度特征的代价体层,以及用于回归的全局特征聚合网络。
- 代价体层编码了从 LiDAR 点云投影得到的深度特征与 RGB 图像特征之间的相关性,实现结构化的特征匹配。
- 网络不直接回归绝对外参,而是预测相对于初始标定值到真实值的偏差,从而提升训练稳定性。
- 采用多任务损失:对预测的外参使用平滑 L1 损失,同时引入自监督点云距离损失以增强几何一致性。
- 推理阶段应用迭代优化,网络使用预测参数重新投影点云,并在多轮迭代中逐步优化估计结果。
- 通过多帧之间的时序滤波进一步降低标定误差,提升鲁棒性与精度。

实验结果
研究问题
- RQ1深度学习模型是否能在不依赖人工标记或人工设置的前提下,实现高精度的端到端 LiDAR-相机自标定?
- RQ2如何有效建模 RGB 图像与深度图像之间的跨传感器特征相关性以提升标定精度?
- RQ3在实时应用中,迭代优化与多帧分析是否能显著降低标定误差?
- RQ4引入自监督点云距离损失是否能提升对初始标定误差与传感器漂移的鲁棒性?
主要发现
- 在 KITTI-odometry 数据集上,LCCNet 实现了 0.297 cm 的平均绝对平移误差(X: 0.262 cm,Y: 0.271 cm,Z: 0.357 cm)与 0.017° 的平均绝对旋转误差(roll: 0.020°,pitch: 0.012°,yaw: 0.019°)。
- 即使在 ±1.5 m 的平移与 ±20° 的旋转大范围偏差下,该方法仍保持高精度,优于先前基于学习的方法。
- 网络在单张 GPU 上每轮推理耗时 24 ms,展现出适用于在线部署的实时推理能力。
- 通过五轮迭代优化与多帧时序滤波,显著降低了标定误差,提升了对初始参数偏差的鲁棒性。
- 自监督点云距离损失增强了泛化能力,并降低了对初始标定误差的敏感性,表现为不同初始化下误差分布的一致性。
- 在精度与鲁棒性方面,LCCNet 显著优于现有最先进方法(如 Regnet 与 Calibnet),尤其在大范围标定偏差条件下表现更优。

更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。