Skip to main content
QUICK REVIEW

[论文解读] Multi-level Contextual RNNs with Attention Model for Scene Labeling

Heng Fan, Xue Mei|arXiv (Cornell University)|Jul 8, 2016
Advanced Image and Video Retrieval Techniques参考文献 34被引用 13
一句话总结

该论文提出了一种带有注意力机制的多层级上下文循环神经网络(ML-CRNNs),用于场景标注,通过将局部、全局和图像主题上下文整合到分层CNN中,以建模长距离的空间和语义依赖关系。该方法在CamVid、SiftFlow和Stanford-background数据集上取得了最先进性能,其中基于注意力的特征融合策略优于平均池化和最大池化策略。

ABSTRACT

Context in image is crucial for scene labeling while existing methods only exploit local context generated from a small surrounding area of an image patch or a pixel, by contrast long-range and global contextual information is ignored. To handle this issue, we in this work propose a novel approach for scene labeling by exploring multi-level contextual recurrent neural networks (ML-CRNNs). Specifically, we encode three kinds of contextual cues, i.e., local context, global context and image topic context in structural recurrent neural networks (RNNs) to model long-range local and global dependencies in image. In this way, our method is able to `see' the image in terms of both long-range local and holistic views, and make a more reliable inference for image labeling. Besides, we integrate the proposed contextual RNNs into hierarchical convolutional neural networks (CNNs), and exploit dependence relationships in multiple levels to provide rich spatial and semantic information. Moreover, we novelly adopt an attention model to effectively merge multiple levels and show that it outperforms average- or max-pooling fusion strategies. Extensive experiments demonstrate that the proposed approach achieves new state-of-the-art results on the CamVid, SiftFlow and Stanford-background datasets.

研究动机与目标

  • 为解决现有场景标注方法仅依赖局部上下文而导致视觉相似像素分类错误的局限性。
  • 在统一的RNN框架中建模长距离的局部、全局和图像主题上下文,以提升语义理解能力。
  • 将上下文RNN集成到分层CNN中,以利用多层级的空间和语义依赖关系。
  • 开发一种基于注意力的特征融合机制,其性能优于平均池化和最大池化策略,用于组合多层级特征。
  • 在无需CRF等后处理技术的情况下实现最先进性能,证明所提出架构的鲁棒性。

提出的方法

  • 该方法采用三种类型的上下文线索——局部(8个最近邻)、全局(整个图像)和图像主题(图像级语义)——通过结构化RNN进行编码,以建模长距离依赖关系。
  • 通过基于标签相似性的加权RNN对局部上下文进行建模,其中权重根据一致性邻居的影响动态学习,从而增强一致邻居的影响。
  • 将RNN应用于多个CNN层(第3、4和5个池化层)的特征图,以捕捉分层的空间和语义表征。
  • 采用注意力机制动态加权不同层级的贡献,学习最优的融合权重以实现更优的特征整合。
  • 构建端到端训练流程,使用上采样层生成密集的像素级预测,实现完全监督。

实验结果

研究问题

  • RQ1在RNN中建模多层级上下文信息(局部、全局和主题)是否能相比仅依赖局部上下文的方法提升场景标注的准确性?
  • RQ2将分层CNN特征与上下文RNN结合,如何增强场景标注的空间和语义特征表征?
  • RQ3基于注意力的特征融合机制是否优于传统的池化策略(平均或最大池化),用于组合多层级特征?
  • RQ4全局和主题上下文在提升罕见或视觉模糊类别上的性能方面能发挥多大作用?
  • RQ5所提出的ML-CRNNs是否能在无需CRF等后处理技术的情况下实现最先进性能?

主要发现

  • 在CamVid数据集上,所提出的带有注意力机制的ML-CRNNs实现了86.9%的像素准确率和57.7%的类别准确率,优于之前最先进方法。
  • 在SiftFlow数据集上,该方法实现了86.9%的像素准确率和57.7%的类别准确率,超过之前最佳结果85.3%和55.7%。
  • 在Stanford-background数据集上,该方法实现了87.2%的像素准确率和78.4%的类别准确率,优于先前最先进结果84.6%和77.3%。
  • 基于注意力的特征融合策略显著优于平均池化和最大池化融合策略,证明其在学习最优特征整合方面的有效性。
  • 即使不使用CRF后处理,该模型仍实现了最先进性能,证明了多层级上下文RNN设计的鲁棒性。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。