[论文解读] CAM-Convs: Camera-Aware Multi-Scale Convolutions for Single-View Depth
本文提出CAM-Convs,一种新型卷积层,将相机内参融入深度神经网络以实现单目深度估计,使模型能够跨不同相机型号泛化。通过将相机参数与特征图融合,CAM-Convs使单一网络在无需微调的情况下,对多种相机保持高精度,显著优于在未见相机内参上测试的最先进方法。
Single-view depth estimation suffers from the problem that a network trained on images from one camera does not generalize to images taken with a different camera model. Thus, changing the camera model requires collecting an entirely new training dataset. In this work, we propose a new type of convolution that can take the camera parameters into account, thus allowing neural networks to learn calibration-aware patterns. Experiments confirm that this improves the generalization capabilities of depth prediction networks considerably, and clearly outperforms the state of the art when the train and test images are acquired with different cameras.
研究动机与目标
- 解决单目深度估计网络在不同相机型号图像上测试时泛化能力不足的问题。
- 使单一深度预测网络在无需微调或架构修改的情况下,对多种相机内参均表现良好。
- 克服当前网络对特定相机参数过拟合的局限性,即使在多样化数据集上训练也是如此。
- 实现对任意相机图像的高效利用,且在新相机型号上不会导致性能下降。
提出的方法
- 提出CAM-Convs,一种修改后的卷积层,将相机内参(焦距、主点)在每一层与特征图拼接。
- 在网络早期阶段集成相机参数,使模型在特征提取过程中学习相机特定模式。
- 采用多尺度编码器-解码器架构,CAM-Convs在多个层级应用,以保持空间与几何一致性。
- 在来自不同相机的数据集混合数据上进行训练,包括NYUv2、KITTI和MegaDepth,涵盖不同的内参和数据分布。
- 对具有至尺度真实值的数据集(如MegaDepth)应用尺度不变损失函数,避免绝对深度尺度带来的偏差。
- 通过裁剪和缩放图像增强训练数据,模拟不同传感器尺寸和焦距,增加相机参数的多样性。
实验结果
研究问题
- RQ1单一深度预测网络是否能在不微调的情况下泛化到不同相机型号?
- RQ2将相机内参集成到网络架构中是否能提升对未见相机内参的泛化能力?
- RQ3在具有不同内参的多种相机上训练的网络,是否能在测试时对训练中未见的相机型号保持高精度?
- RQ4标准网络若缺乏相机参数信息,是否会在相机参数变化时导致性能下降?
主要发现
- CAM-Convs显著提升泛化能力:与仅在NYUv2上训练的最先进模型相比,该网络在六种不同相机配置(包括未见配置)下均实现更低的平均误差和方差。
- 在排除NYUv2的多个数据集上训练的网络,在NYUv2测试集上的表现优于SOTA模型[21],即使未在NYUv2上训练,也展现出强大的泛化能力。
- 采用CAM-Convs的网络在不同图像分辨率和相机内参下均保持一致的深度预测,而基线模型[21]无法泛化,在内参变化下表现出高误差方差。
- 若缺乏相机参数集成,网络在混合了不同内参的数据集上训练时无法收敛,凸显了校准感知学习的必要性。
- 定性结果表明,CAM-Convs在NYUv2、KITTI和MegaDepth数据集上均能产生稳定且准确的深度预测,即使图像被裁剪或缩放以模拟不同相机。
- 该方法可有效利用来自各种相机的真实世界多样化图像进行训练,且在新相机型号上不会导致性能下降。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。