Skip to main content
QUICK REVIEW

[论文解读] Adaptable Deformable Convolutions for Semantic Segmentation of Fisheye Images in Autonomous Driving Systems

Clément Playout, Ola Ahmad|arXiv (Cornell University)|Feb 19, 2021
Advanced Neural Network Applications参考文献 20被引用 17
一句话总结

本文提出了一种新颖的语义分割模型自适应方法,通过可变形卷积处理鱼眼图像,仅需少量标注的鱼眼数据即可实现高性能。通过在不微调主干网络权重的前提下学习卷积滤波器的空间偏移量,该方法在仅使用50个训练样本的情况下即实现了鱼眼图像分割的最先进性能,显著降低了对大规模标注数据集的依赖。

ABSTRACT

Advanced Driver-Assistance Systems rely heavily on perception tasks such as semantic segmentation where images are captured from large field of view (FoV) cameras. State-of-the-art works have made considerable progress toward applying Convolutional Neural Network (CNN) to standard (rectilinear) images. However, the large FoV cameras used in autonomous vehicles produce fisheye images characterized by strong geometric distortion. This work demonstrates that a CNN trained on standard images can be readily adapted to fisheye images, which is crucial in real-world applications where time-consuming real-time data transformation must be avoided. Our adaptation protocol mainly relies on modifying the support of the convolutions by using their deformable equivalents on top of pre-existing layers. We prove that tuning an optimal support only requires a limited amount of labeled fisheye images, as a small number of training samples is sufficient to significantly improve an existing model's performance on wide-angle images. Furthermore, we show that finetuning the weights of the network is not necessary to achieve high performance once the deformable components are learned. Finally, we provide an in-depth analysis of the effect of the deformable convolutions, bringing elements of discussion on the behavior of CNN models.

研究动机与目标

  • 为解决将预训练的CNN应用于鱼眼图像所面临的挑战,因为鱼眼图像由于超广角视场(FoV)镜头而表现出强烈的几何失真。
  • 通过仅使用少量标注样本即可实现模型自适应,减少对真实鱼眼图像大规模、耗时标注的依赖。
  • 开发一种灵活、即插即用的自适应机制,在保持预训练权重不变的同时,通过可变形卷积学习空间偏移量。
  • 评估可变形卷积是否能在不重新训练整个网络的前提下,有效建模鱼眼图像中的非线性失真。
  • 探索自监督偏移学习的可行性,以在未来进一步降低标注成本。

提出的方法

  • 该方法在预训练的标准CNN层之上应用可变形卷积,以自适应地适应鱼眼图像,而无需修改原始网络权重。
  • 引入可学习的空间偏移量用于卷积滤波器,使网络能够动态调整采样位置,以补偿桶形失真。
  • 可变形组件通过反向传播和交叉熵损失进行训练,而网络其余部分在自适应过程中保持冻结。
  • 该方法在具有不同程度失真(由参数f控制)的模拟鱼眼数据上进行评估,使用Cityscapes和BlendedMVS数据集。
  • 自适应过程独立于主干网络权重进行,仅可选地对批量归一化层进行微调。
  • 通过多种训练集大小(1、50、100、1000)对方法进行验证,以评估其样本效率。

实验结果

研究问题

  • RQ1可变形卷积是否可以有效用于在不重新训练主干网络的前提下,自适应预训练CNN以实现鱼眼图像的语义分割?
  • RQ2使用所提出的自适应方法,需要多少标注的鱼眼图像才能实现显著的性能提升?
  • RQ3仅学习可变形偏移量,同时保持原始网络权重冻结,其性能是否可与完整微调或重新训练相媲美?
  • RQ4所提出的方法是否能在不重新训练的情况下泛化到不同鱼眼相机参数(例如,不同的f值)?
  • RQ5该自适应机制是否可扩展至自监督学习,以完全消除对标注鱼眼数据的需求?

主要发现

  • 仅使用50张标注的鱼眼图像,该自适应模型在f=125的Cityscapes数据集上实现了0.643的平均交并比(mIoU),接近从零开始重新训练模型的性能。
  • mIoU从非自适应模型的0.420提升至0.643,表明仅用极少数据即可实现显著的性能提升。
  • 即使仅使用一张标注的鱼眼图像,mIoU也下降至0.390,表明自适应存在最低数据阈值,但性能随少量数据增加而迅速提升。
  • 自适应模型在使用完整2675张图像训练集时,mIoU达到0.676,优于微调基线模型(fish-DL3)的0.615。
  • 该方法在不微调主干网络权重的情况下实现了高性能,证明仅通过学习偏移量即可实现有效的自适应。
  • 结果表明,可变形卷积能够有效建模鱼眼图像中的非线性失真,从而在极低数据和计算成本下实现稳健的自适应。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。