Skip to main content
QUICK REVIEW

[论文解读] Learning Common and Specific Features for RGB-D Semantic Segmentation with Deconvolutional Networks

Jinghua Wang, Zhenhua Wang|arXiv (Cornell University)|Aug 3, 2016
Advanced Neural Network Applications参考文献 30被引用 12
一句话总结

该论文提出了一种去卷积网络,配备一种新颖的特征转换模块,能够从RGB和深度输入中显式学习共有的特征与模态特定的特征,用于室内语义分割。通过利用最大均值差异(MK-MMD)对齐特征分布,并实现模态间共用特征的借用,该方法在NYU Depth V1和V2数据集上实现了最先进(SOTA)的准确率,相较于之前的方法,平均准确率最高提升7.4%。

ABSTRACT

In this paper, we tackle the problem of RGB-D semantic segmentation of indoor images. We take advantage of deconvolutional networks which can predict pixel-wise class labels, and develop a new structure for deconvolution of multiple modalities. We propose a novel feature transformation network to bridge the convolutional networks and deconvolutional networks. In the feature transformation network, we correlate the two modalities by discovering common features between them, as well as characterize each modality by discovering modality specific features. With the common features, we not only closely correlate the two modalities, but also allow them to borrow features from each other to enhance the representation of shared information. With specific features, we capture the visual patterns that are only visible in one modality. The proposed network achieves competitive segmentation accuracy on NYU depth dataset V1 and V2.

研究动机与目标

  • 通过建模共享特征与模态特定特征,提升RGB-D语义分割的准确率。
  • 解决先前方法仅在决策层面融合特征或使用浅层拼接的局限性。
  • 通过共享共用特征实现模态间特征借用,以增强模型的鲁棒性与表征能力。
  • 设计一种特征转换网络,通过分布级相似性解耦共用特征与特定特征。
  • 在现有最先进方法的基础上,于标准RGB-D基准数据集上展示更优的性能表现。

提出的方法

  • 采用双分支网络架构,为RGB和深度模态分别设计独立的卷积与去卷积网络。
  • 引入特征转换网络,将顶层卷积特征分解为共用特征(跨模态共享)与模态特定特征(各模态独有)。
  • 使用最大核均值差异(MK-MMD)度量并优化特征分布间的相似性,替代欧氏距离以提升鲁棒性。
  • 将每个模态的去卷积网络同时输入自身特定特征与另一模态的共用特征,实现模态间特征补偿。
  • 通过线性组合去卷积输出实现决策得分融合,借助对称的特征借用机制增强鲁棒性。
  • 采用端到端训练,通过标准反向传播联合优化所有组件。

实验结果

研究问题

  • RQ1显式建模共用特征与模态特定特征是否能提升RGB-D语义分割性能?
  • RQ2在特征层面而非决策层面学习特征相关性,是否能带来更高的分割准确率?
  • RQ3通过共用特征实现模态间特征借用,是否能提升低数据场景下的鲁棒性与表征能力?
  • RQ4相较于欧氏距离,MK-MMD是否是学习多模态分割中共享特征分布的更优度量?
  • RQ5所提方法在标准RGB-D基准数据集上与现有最先进方法相比表现如何?

主要发现

  • 在13类NYU Depth V2数据集上,该方法达到52.7%的平均类别准确率,相较于之前SOTA方法(Wang et al., 2018)提升10.5个百分点。
  • 在40类分割任务中,该方法实现47.3%的平均准确率,超越此前最佳结果(U-DN)5.6个百分点。
  • 相较于基线方法B-DN(两个独立的去卷积网络),在NYU Depth V2上提升5.1个百分点,证明了特征级融合的有效性。
  • 在NYU Depth V1上,使用MK-MMD进行特征对齐相较欧氏距离基线(E-DN)提升7.4%,表明其在处理分布差异方面更具优势。
  • 该方法对得分融合中的线性组合参数更具鲁棒性,因为共享特征借用使两个模态的去卷积输出更为相似。
  • 消融实验确认模态特定特征至关重要,抑制它们会导致性能显著下降,尤其在纹理丰富或深度模糊的区域。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。