Skip to main content
QUICK REVIEW

[论文解读] DCANet: Differential Convolution Attention Network for RGB-D Semantic Segmentation

Lizhi Bai, Jun Yang|arXiv (Cornell University)|Oct 13, 2022
Advanced Neural Network Applications被引用 7
一句话总结

本文提出DCANet,一种用于RGB-D语义分割的新型双分支网络,采用差分卷积注意力(DCA)处理深度数据,采用集成差分卷积注意力(EDCA)处理RGB数据。DCA通过基于像素差异的动态加权机制捕捉局部几何一致性,而EDCA则通过类似机制建模RGB特征中的长程依赖与空间上下文。在NYUDv2和SUN-RGBD数据集上,DCANet在多尺度测试下分别取得53.3%和49.6%的mIoU,达到当前最先进性能。

ABSTRACT

Combining RGB images and the corresponding depth maps in semantic segmentation proves the effectiveness in the past few years. Existing RGB-D modal fusion methods either lack the non-linear feature fusion ability or treat both modal images equally, regardless of the intrinsic distribution gap or information loss. Here we find that depth maps are suitable to provide intrinsic fine-grained patterns of objects due to their local depth continuity, while RGB images effectively provide a global view. Based on this, we propose a pixel differential convolution attention (DCA) module to consider geometric information and local-range correlations for depth data. Furthermore, we extend DCA to ensemble differential convolution attention (EDCA) which propagates long-range contextual dependencies and seamlessly incorporates spatial distribution for RGB data. DCA and EDCA dynamically adjust convolutional weights by pixel difference to enable self-adaptive in local and long range, respectively. A two-branch network built with DCA and EDCA, called Differential Convolutional Network (DCANet), is proposed to fuse local and global information of two-modal data. Consequently, the individual advantage of RGB and depth data are emphasized. Our DCANet is shown to set a new state-of-the-art performance for RGB-D semantic segmentation on two challenging benchmark datasets, i.e., NYUDv2 and SUN-RGBD.

研究动机与目标

  • 解决现有RGB-D特征融合方法对两种模态同等对待的问题,尽管其在表征方式与信息内容上存在本质差异。
  • 通过挖掘深度图的局部几何一致性与RGB图像的全局上下文模式,提升特征表征能力。
  • 设计一种自适应注意力机制,基于像素差异动态调整卷积权重,以增强局部与长程特征学习能力。
  • 通过引入模态特异的注意力模块,在RGB-D语义分割中实现最先进性能。

提出的方法

  • 提出差分卷积注意力(DCA)模块,通过中心像素与其邻域像素间的像素级差异动态调整卷积权重,从而增强深度图中局部几何模式的捕捉能力。
  • 将DCA扩展为集成差分卷积注意力(EDCA),利用相似的动态加权机制,对RGB特征建模长程依赖并整合空间分布信息。
  • 设计双分支网络架构,将DCA应用于深度流,EDCA应用于RGB流,实现在特征融合前的模态特异性特征增强。
  • 利用DCA与EDCA生成的可学习注意力图,对特征表示进行优化,使模型能够聚焦于相关空间与几何模式。
  • 采用多尺度推理策略,在不改变网络架构的前提下提升基准数据集上的性能。
  • 将DCA与EDCA作为即插即用模块集成,支持在现有分割框架中轻松部署。

实验结果

研究问题

  • RQ1鉴于RGB与深度数据在几何与光度特性上的显著差异,如何有效利用其互补优势进行语义分割?
  • RQ2基于像素差异的动态卷积机制是否能改善深度图中局部特征的表征能力?
  • RQ3是否可通过空间感知的自适应注意力机制更有效地捕捉RGB数据中的长程上下文依赖?
  • RQ4与同质化融合策略相比,模态特异的注意力设计是否能带来RGB-D语义分割性能的提升?

主要发现

  • 在NYUDv2测试集的多尺度测试下,DCANet取得53.3%的新SOTA mIoU,相比最接近的基线方法提升3.7个百分点。
  • 在SUN-RGBD数据集上,DCANet在多尺度测试下达到49.6%的mIoU,超越此前SOTA方法1.5个百分点。
  • 消融实验表明,DCA显著提升了深度特征表征能力,尤其在外观相似但深度不同的区域中捕捉到细粒度几何模式。
  • EDCA有效增强了RGB特征的全局上下文建模能力,使模型在光照复杂或存在遮挡的条件下仍能实现更优的分割效果。
  • 注意力图可视化显示,DCA聚焦于局部深度不连续区域(如物体边缘),而EDCA则突出RGB图像中语义有意义的全局结构。
  • DCA与EDCA的即插即用设计使其在不同主干网络架构与数据集上均能实现一致的性能增益。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。