Skip to main content
QUICK REVIEW

[论文解读] Scene Labeling using Gated Recurrent Units with Explicit Long Range Conditioning

Qiangui Huang, Weiyue Wang|arXiv (Cornell University)|Nov 22, 2016
Medical Image Segmentation Techniques参考文献 40被引用 4
一句话总结

本文提出GRU-ELC,一种带有显式长程条件控制的门控循环单元,以克服传统RNN在建模图像中长程空间依赖时的‘梯度消失’问题。通过跳跃连接显式地将隐藏状态与远距离的上下文相关特征进行条件化,GRU-ELC实现了有效的多尺度上下文建模,在三个标准场景标注数据集上取得了最先进性能,显著提升了窗户、门和物体边界等精细结构的分割效果。

ABSTRACT

Recurrent neural network (RNN), as a powerful contextual dependency modeling framework, has been widely applied to scene labeling problems. However, this work shows that directly applying traditional RNN architectures, which unfolds a 2D lattice grid into a sequence, is not sufficient to model structure dependencies in images due to the "impact vanishing" problem. First, we give an empirical analysis about the "impact vanishing" problem. Then, a new RNN unit named Recurrent Neural Network with explicit long range conditioning (RNN-ELC) is designed to alleviate this problem. A novel neural network architecture is built for scene labeling tasks where one of the variants of the new RNN unit, Gated Recurrent Unit with Explicit Long-range Conditioning (GRU-ELC), is used to model multi scale contextual dependencies in images. We validate the use of GRU-ELC units with state-of-the-art performance on three standard scene labeling datasets. Comprehensive experiments demonstrate that the new GRU-ELC unit benefits scene labeling problem a lot as it can encode longer contextual dependencies in images more effectively than traditional RNN units.

研究动机与目标

  • 研究标准RNN在应用于2D图像数据时,由于2D到1D展开后序列长度过长,导致的‘影响消失’问题的局限性。
  • 解决传统RNN难以有效捕捉图像中长程空间依赖的问题,尽管使用了GRU或LSTM。
  • 设计一种新型RNN单元RNN-ELC,通过显式地将隐藏状态与远距离的上下文相关特征进行条件化,以保留长程上下文信息。
  • 开发一种基于GRU-ELC单元的新场景标注框架,可与CNN无缝集成,实现端到端训练。
  • 在标准场景标注基准上展示最先进性能,提升对细粒度结构和稀有类别的分割准确性。

提出的方法

  • 提出RNN-ELC,一种广义RNN单元,通过可学习的条件化机制,显式地将当前隐藏状态与多个时间上相距较远但空间上相关的特征进行条件化。
  • 设计GRU-ELC作为RNN-ELC的一个具体变体,结合更新门和重置门,并引入显式长程条件控制,以在长序列中稳定梯度流动。
  • 在RNN架构中引入非相邻隐藏状态之间的跳跃连接,以直接传播长程上下文信息。
  • 将GRU-ELC单元集成到基于CNN的编码器-解码器框架中,使用VGG-16(conv3_3或conv4_3)的特征作为输入,实现端到端训练。
  • 训练过程中采用中位数频率平衡策略,以提升对稀有类别的性能,增强对低资源类别的泛化能力。
  • 采用多尺度解码器,结合上采样和卷积层,以重建全分辨率的分割图。

实验结果

研究问题

  • RQ1当将2D图像网格展开为1D序列时,'影响消失'问题是否显著降低RNN在建模长程空间依赖时的性能?
  • RQ2在从图像数据导出的长序列中,RNN单元中显式长程条件控制是否能有效缓解梯度消失问题?
  • RQ3GRU-ELC在建模场景标注的多尺度上下文依赖方面,与标准GRU和LSTM相比表现如何?
  • RQ4所提出的基于GRU-ELC的模型在提升细结构和稀有类别分割准确性方面,改善程度如何?
  • RQ5GRU-ELC单元能否有效集成到基于CNN的端到端场景标注框架中?

主要发现

  • GRU-ELC在三个标准场景标注数据集(SiftFlow、NYUDv2和Stanford Background)上均达到最先进性能。
  • 在SiftFlow数据集中,模型在天空类别上达到96.7%的准确率(训练数据占比24.4%),在太阳类别上达到96.5%(训练数据占比0.008%),表明其在稀有类别上表现强劲。
  • 模型显著提升了局部细节的保留能力,能够准确分割窗户、门、显示器和电视屏幕等在真实标签中并不总是存在的精细结构。
  • 视觉对比显示,与FCN-8s和Eigen等人方法相比,GRU-ELC在NYUDv2数据集上具有更优的边界检测能力并减少了过度分割现象。
  • 逐类别分析表明,各类别性能稳定,即使在低资源类别(如鸟类28.3%、标志75.1%)上也保持高准确率。
  • 采用中位数频率平衡策略进一步提升了稀有类别的性能,证实其与GRU-ELC结合具有显著有效性。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。