[论文解读] Dense Recurrent Neural Networks for Scene Labeling
本文提出了一种用于场景标注的密集循环神经网络(DD-RNNs),通过密集无向环图(D-UCG)及其分解为密集有向无环图(D-DAGs)的方式,对图像所有单元之间的丰富密集上下文依赖关系进行建模。通过在RNN框架中引入注意力机制以优先关注相关长距离依赖关系,并与CNN结合,该方法在PASCAL Context、MIT ADE20K和SiftFlow基准上实现了最先进性能,优于以往基于RNN和基于CNN的方法。
Recently recurrent neural networks (RNNs) have demonstrated the ability to improve scene labeling through capturing long-range dependencies among image units. In this paper, we propose dense RNNs for scene labeling by exploring various long-range semantic dependencies among image units. In comparison with existing RNN based approaches, our dense RNNs are able to capture richer contextual dependencies for each image unit via dense connections between each pair of image units, which significantly enhances their discriminative power. Besides, to select relevant and meanwhile restrain irrelevant dependencies for each unit from dense connections, we introduce an attention model into dense RNNs. The attention model enables automatically assigning more importance to helpful dependencies while less weight to unconcerned dependencies. Integrating with convolutional neural networks (CNNs), our method achieves state-of-the-art performances on the PASCAL Context, MIT ADE20K and SiftFlow benchmarks.
研究动机与目标
- 为解决CNN在捕捉长距离上下文依赖关系方面的局限性,该局限性会导致视觉上相似的像素(如沙地与道路)被错误分类。
- 为克服现有基于RNN的场景标注方法在依赖关系建模上的限制,这些方法依赖于UCG的稀疏DAG近似,因而会遗漏关键的长距离线索。
- 通过密集无向环图(D-UCG)结构,利用所有可能的成对依赖关系,增强图像单元的判别能力。
- 在RNN框架内引入注意力机制,以选择性地关注相关上下文依赖关系,同时抑制无关依赖关系。
- 开发一个端到端的场景标注系统,将DD-RNNs与CNN结合,以在标准基准上实现卓越性能。
提出的方法
- 提出一种密集无向环图(D-UCG),其中每个图像单元均与其它所有单元相连,从而实现全面的依赖关系建模。
- 将D-UCG分解为多个密集有向无环图(D-DAGs),以支持前向传播RNN处理和反向传播。
- 设计基于DAG结构的密集RNN(DD-RNNs),通过密集连接在所有图像单元之间传播信息,从而捕捉比标准RNN更丰富的上下文线索。
- 在DD-RNNs中引入注意力机制,以动态地为信息量丰富的依赖关系(如“水”对“沙地”分类)分配更高权重,同时为无关依赖关系(如“天空”)分配较低权重。
- 采用混合架构,结合预训练的VGG-based CNN进行特征提取,DD-RNNs用于上下文推理,随后通过转置卷积层实现全分辨率分割。
- 使用CRF后处理进一步优化预测结果,在所有基准上提升IoU和准确率。
实验结果
研究问题
- RQ1通过密集无向环图(D-UCG)对图像单元之间的所有成对依赖关系进行建模,是否能相比稀疏或基于DAG的依赖关系建模方式,显著提升场景标注性能?
- RQ2在RNN中引入注意力机制是否有助于选择最相关的长距离依赖关系,同时抑制无关依赖关系,从而增强模型的判别能力?
- RQ3将DD-RNNs与CNN结合是否能实现在标准场景标注基准上的最先进性能?
- RQ4与以往基于RNN和基于CNN的方法相比,该方法在准确率、IoU以及对模糊像素类别的鲁棒性方面表现如何?
- RQ5注意力机制对模型性能有何影响?其效果是否在不同数据集上均保持一致并持续提升性能?
主要发现
- 在PASCAL Context基准上,所提出的DD-RNNs实现了36.3%的平均IoU,优于基线模型(32.1%)以及SOTA方法如FCN-8s+Prior(32.9%)和Cascade-Dilated(34.9%)。
- 在MIT ADE20K上,该方法在不使用CRF时达到35.7%的平均IoU,使用CRF后提升至36.3%,优于基线模型(32.1%),并超越ParseNet(34.9%)和Cascade-SegNet(27.5%)。
- 在SiftFlow上,该方法在使用CRF后实现了46.3%的平均IoU,显著优于先前SOTA方法(DAG-RNN-CRF为44.8%)和FCN-8s(41.2%)。
- 消融实验表明,注意力机制在所有数据集上均提升了性能:例如在SiftFlow上,当不使用CRF时,IoU从45.2%(无注意力)提升至45.9%(有注意力)。
- 该模型具有高效性,模型大小为190 MB,单张图像推理时间为280 ms,优于更大模型如FCN-8s(497 MB,320 ms)和DilatedNet(513 MB,360 ms)。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。