Skip to main content
QUICK REVIEW

[论文解读] Depth-Adapted CNNs for RGB-D Semantic Segmentation

Zongwei Wu, Guillaume Allibert|arXiv (Cornell University)|Jun 8, 2022
Industrial Vision Systems and Defect Detection被引用 7
一句话总结

本文提出Z-ACN,一种新颖的深度自适应CNN框架,通过学习几何感知的采样位置,将深度信息直接整合到RGB卷积神经网络中。通过用基于3D平面对齐重塑感受野的深度自适应算子替代标准卷积和平均池化操作,该方法在室内和室外RGB-D基准测试中显著提升了语义分割的准确性,以极低的计算开销实现了最先进性能。

ABSTRACT

Recent RGB-D semantic segmentation has motivated research interest thanks to the accessibility of complementary modalities from the input side. Existing works often adopt a two-stream architecture that processes photometric and geometric information in parallel, with few methods explicitly leveraging the contribution of depth cues to adjust the sampling position on RGB images. In this paper, we propose a novel framework to incorporate the depth information in the RGB convolutional neural network (CNN), termed Z-ACN (Depth-Adapted CNN). Specifically, our Z-ACN generates a 2D depth-adapted offset which is fully constrained by low-level features to guide the feature extraction on RGB images. With the generated offset, we introduce two intuitive and effective operations to replace basic CNN operators: depth-adapted convolution and depth-adapted average pooling. Extensive experiments on both indoor and outdoor semantic segmentation tasks demonstrate the effectiveness of our approach.

研究动机与目标

  • 解决现有两流结构与早期融合RGB-D网络在特征提取中未能有效利用深度线索的局限性。
  • 开发一种显式利用深度信息引导RGB特征提取中空间采样以提升上下文感知能力的方法。
  • 提出深度自适应算子,替代标准CNN操作,同时保持与预训练模型的兼容性。
  • 验证该方法在不同相机内参和真实世界深度误差下的鲁棒性。
  • 在多样化的室内与室外数据集上展示泛化能力,并实现显著的性能提升。

提出的方法

  • 提出深度自适应卷积(Z-Conv),通过选择与中心点位于同一3D平面的像素重新定义感受野,利用深度信息和相机参数计算2D偏移量。
  • 引入深度自适应平均池化(Z-AvgPool),在几何一致区域而非规则网格邻域上计算均值。
  • 使用低层次深度特征生成空间偏移图以引导采样,确保特征图上几何一致性。
  • 采用可微分且可学习的偏移生成模块,完全受深度和相机内参约束,支持端到端训练。
  • 将该算子应用于VGG与ResNet编码器,实现对现有CNN架构的最小修改即可集成。
  • 从头训练并使用ImageNet预训练权重进行微调,验证其迁移能力与鲁棒性。

实验结果

研究问题

  • RQ1能否在不增加额外参数的前提下,有效利用深度信息引导RGB CNN中的空间采样?
  • RQ2用深度自适应算子替代标准卷积与池化操作,是否能提升RGB-D数据上的语义分割准确性?
  • RQ3该方法对相机内参不准确或深度估计误差的鲁棒性如何?
  • RQ4在不同网络深度应用深度自适应操作时,性能提升的幅度有多大?
  • RQ5所提出的算子能否在预训练ImageNet权重上实现有效迁移与微调?

主要发现

  • 在NYUv2数据集上,使用真实相机内参时,Z-ACN达到42.5% mIoU与55.2% mAcc,显著优于基线模型(40.4% mIoU,51.9% mAcc)。
  • 即使使用随机选择的相机内参,Z-ACN仍保持优异性能(41.6% mIoU,53.4% mAcc),表明对参数不确定性的强鲁棒性。
  • 仅将最深层(Conv5_1)的第一个卷积替换为Z-Conv时,从头训练可实现3.6% mIoU的增益。
  • 将所有首层卷积替换为Z-Conv后,mIoU相较基线提升5.7%,证明早期几何引导的有效性。
  • 引入Z-AvgPool后,与Z-Conv结合可使mIoU进一步提升0.9%,证实几何池化的优势。
  • 在微调预训练权重时,将最深层的第一个卷积替换为Z-Conv,mIoU相较基线提升1.8%,表明与迁移学习的兼容性良好。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。