Skip to main content
QUICK REVIEW

[论文解读] DAG-Recurrent Neural Networks For Scene Labeling

Bing Shuai, Zhen Zuo|arXiv (Cornell University)|Sep 2, 2015
Medical Image Segmentation Techniques参考文献 44被引用 16
一句话总结

该论文提出DAG循环神经网络(DAG-RNNs),通过将图像单元结构化为有向无环图(DAGs),以建模场景标注中的长距离上下文依赖关系,使RNN能够有效捕捉远距离图像区域之间的语义关系。该方法增强了局部特征的判别能力,并与卷积和转置卷积层结合,实现端到端训练,在SiftFlow、CamVid和Barcelona基准上取得最先进性能,通过一种新型类别加权函数在罕见类别上实现8.6%的显著准确率提升。

ABSTRACT

In image labeling, local representations for image units are usually generated from their surrounding image patches, thus long-range contextual information is not effectively encoded. In this paper, we introduce recurrent neural networks (RNNs) to address this issue. Specifically, directed acyclic graph RNNs (DAG-RNNs) are proposed to process DAG-structured images, which enables the network to model long-range semantic dependencies among image units. Our DAG-RNNs are capable of tremendously enhancing the discriminative power of local representations, which significantly benefits the local classification. Meanwhile, we propose a novel class weighting function that attends to rare classes, which phenomenally boosts the recognition accuracy for non-frequent classes. Integrating with convolution and deconvolution layers, our DAG-RNNs achieve new state-of-the-art results on the challenging SiftFlow, CamVid and Barcelona benchmarks.

研究动机与目标

  • 为解决场景标注中局部图像表示的局限性,后者往往无法捕捉长距离上下文依赖关系。
  • 克服标准RNN与常用于建模图像单元的环状无向图(UCGs)之间的不兼容性。
  • 通过结构化循环建模编码全局场景上下文,提升局部特征的判别能力。
  • 缓解由于自然场景图像中类别频率不平衡导致的罕见语义类别性能下降问题。
  • 开发一个结合卷积、DAG-RNN和转置卷积的端到端可训练全标注网络,用于密集预测。

提出的方法

  • 该论文将图像单元建模为无向环状图(UCG),并将其分解为多个有向无环图(DAGs),以支持RNN的应用。
  • 提出DAG-RNNs作为标准RNN的泛化形式,用于处理DAG结构化数据,允许按拓扑顺序对节点进行序列处理。
  • 每个DAG由DAG-RNN独立处理,生成编码长距离依赖关系的上下文感知隐藏表示。
  • 将多个DAG生成的上下文感知特征进行融合,并与卷积和转置卷积层结合,形成端到端可训练的全标注网络。
  • 提出一种新型类别加权函数,在训练过程中动态关注罕见类别,提升其识别准确率。
  • 通过反向传播进行端到端训练,DAG-RNN通过循环消息传递实现上下文特征的优化。

实验结果

研究问题

  • RQ1DAG-RNN能否有效建模场景标注中图像单元之间的长距离语义依赖?
  • RQ2通过DAG-RNN建模上下文依赖,如何提升局部图像表示的判别能力?
  • RQ3DAG-RNN在多大程度上能减少场景标注中的局部模糊性,尤其是对视觉上相似的类别(如'sand'和'road')?
  • RQ4新型类别加权函数能否显著提升在类别不平衡数据集中罕见语义类别的识别准确率?
  • RQ5将DAG-RNN与卷积和转置卷积层结合,是否能在标准场景标注基准上实现最先进性能?

主要发现

  • 在SiftFlow数据集的设置1下,当局部特征判别能力较弱时,所提出的DAG-RNN(8)模型相比基线CNN-65实现了11.2%的平均准确率提升。
  • 在设置2中使用预训练的VGG-conv5特征时,DAG-RNN(8)在罕见类别上仍实现了8.6%的显著准确率提升,证明其在强局部特征下依然有效。
  • 在SiftFlow基准上,完整网络(VGG-conv5-DAG-RNN(8))实现了96.3%的全局准确率和55.7%的类别准确率,优于先前最先进方法。
  • 定性结果表明,DAG-RNN同时强制实现局部一致性(相邻像素获得相似标签)和语义一致性(空间上相距较远的像素被分配语义上合理的标签)。
  • 类别加权函数显著提升了罕见类别的识别能力,在SiftFlow上相比标准交叉熵损失,平均类别准确率提升了5.14%。
  • 该方法在三个具有挑战性的基准上均实现最先进性能:SiftFlow、CamVid和Barcelona,所有指标均保持一致提升。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。