Skip to main content
QUICK REVIEW

[论文解读] Incorporating Depth into both CNN and CRF for Indoor Semantic Segmentation

Jindong Jiang, Zhijun Zhang|arXiv (Cornell University)|May 21, 2017
Advanced Image and Video Retrieval Techniques参考文献 1被引用 11
一句话总结

本文提出 DFCN-DCRF,一种新颖的 RGB-D 语义分割框架,通过将深度信息同时整合到空洞全卷积网络(DFCN)和深度感知条件随机场(DCRF)中,实现了在 SUN RGB-D 基准上的最先进性能,平均 IoU 达 39.3%,优于仅在一个组件中使用深度信息的现有方法。

ABSTRACT

To improve segmentation performance, a novel neural network architecture (termed DFCN-DCRF) is proposed, which combines an RGB-D fully convolutional neural network (DFCN) with a depth-sensitive fully-connected conditional random field (DCRF). First, a DFCN architecture which fuses depth information into the early layers and applies dilated convolution for later contextual reasoning is designed. Then, a depth-sensitive fully-connected conditional random field (DCRF) is proposed and combined with the previous DFCN to refine the preliminary result. Comparative experiments show that the proposed DFCN-DCRF has the best performance compared with most state-of-the-art methods.

研究动机与目标

  • 通过超越 RGB 数据利用深度信息,提升室内语义分割的准确性。
  • 解决仅使用 RGB 的 CNN 在具有相似颜色物体的场景中出现的边界误分类问题。
  • 设计一种联合架构,使深度信息同时融入 CNN 和 CRF 组件,以实现更好的上下文推理。
  • 验证在特征学习阶段和后处理阶段同时集成深度信息的有效性。

提出的方法

  • DFCN 模块通过在深层卷积层中使用延迟融合结构,将 RGB 和深度输入在早期阶段融合,随后通过空洞卷积扩大感受野,而无需下采样。
  • 设计了一种深度感知全连接 CRF(DCRF),利用 CRF 潜在函数中的 RGB 和深度特征来建模像素级依赖关系。
  • DFCN-DCRF 框架结合 DFCN 的高层特征与 DCRF 的上下文优化,以改善分割边界。
  • DCRF 使用学习得到的深度感知成对潜在项,以更好地区分具有相似 RGB 外观但不同三维结构的物体。
  • 模型通过在 DFCN 上使用交叉熵损失进行端到端训练,并在 DCRF 中通过近似推理进行优化。
  • 消融研究基于 SUN RGB-D 基准,对比在 DFCN、DCRF 或两者中集成深度信息的效果。

实验结果

研究问题

  • RQ1在 CNN 和 CRF 阶段同时集成深度信息,是否能比仅在一个阶段使用深度信息获得更好的语义分割性能?
  • RQ2与仅使用 RGB 的网络相比,深度信息在 DFCN 中的集成如何影响特征表示?
  • RQ3深度感知 CRF 是否能改善在具有颜色相似物体的室内场景中的边界预测?
  • RQ4深度信息在 DFCN 和 DCRF 中对整体性能提升的相对贡献分别是什么?

主要发现

  • DFCN-DCRF 模型在 SUN RGB-D 基准上实现了 39.3% 的平均 IoU,优于先前的 SOTA 方法 FuseNet-SF5。
  • 仅在 DFCN 中集成深度信息即可带来显著的性能提升(IoU 达 38.0%),表明早期融合有助于增强特征学习。
  • 仅在 DCRF 中加入深度信息(不包含在 DFCN 中)仅带来微小改进(IoU 为 34.4%),表明仅在后处理阶段使用深度信息的收益有限。
  • 在 DFCN 和 DCRF 中同时集成深度信息可获得最佳性能(IoU 为 39.3%),证实了早期与晚期深度融合之间的协同效应。
  • 与仅使用 RGB 的 DFCN 配合 CRF 相比,DFCN-DCRF 将平均准确率提升了 1.9 个百分点,证明了双阶段深度集成的有效性。
  • 可视化结果表明,DFCN-DCRF 能生成更清晰的物体边界,尤其在 RGB 颜色相似但深度结构不同的物体上表现更优。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。