Skip to main content
QUICK REVIEW

[论文解读] Residual Conv-Deconv Grid Network for Semantic Segmentation

Damien Fourure, Rémi Emonet|HAL (Le Centre pour la Communication Scientifique Directe)|Jul 25, 2017
Advanced Neural Network Applications被引用 12
一句话总结

该论文提出了一种新型的残差卷积-转置卷积网格网络(GridNet),用于语义分割。该网络通过在不同分辨率下使用多个相互连接的并行流,既保留了空间细节,又捕获了上下文信息。通过网格状架构在不同尺度上融合特征图,GridNet在从零开始训练时,于Cityscapes数据集上实现了69.45%的mIoU,性能优于多个基线模型,且无需ImageNet预训练。

ABSTRACT

This paper presents GridNet, a new Convolutional Neural Network (CNN) architecture for semantic image segmentation (full scene labelling). Classical neural networks are implemented as one stream from the input to the output with subsampling operators applied in the stream in order to reduce the feature maps size and to increase the receptive field for the final prediction. However, for semantic image segmentation, where the task consists in providing a semantic class to each pixel of an image, feature maps reduction is harmful because it leads to a resolution loss in the output prediction. To tackle this problem, our GridNet follows a grid pattern allowing multiple interconnected streams to work at different resolutions. We show that our network generalizes many well known networks such as conv-deconv, residual or U-Net networks. GridNet is trained from scratch and achieves competitive results on the Cityscapes dataset.

研究动机与目标

  • 解决标准CNN在语义分割中因下采样导致的分辨率损失问题。
  • 设计一种多流架构,在保持高分辨率特征的同时,整合来自低分辨率流的上下文信息。
  • 将U-Net、全卷积网络和残差网络等现有架构统一于一个网格结构中。
  • 在不依赖ImageNet预训练的情况下,实现在语义分割基准上的优异性能。

提出的方法

  • GridNet采用二维网格结构,包含多个在不同分辨率下运行的水平流,通过卷积和转置卷积单元相互连接。
  • 每个流在特定尺度上处理特征图,下采样和上采样层在网格中形成垂直列。
  • 在流内部及流之间使用残差跳跃连接,以促进梯度流动并提高训练稳定性。
  • 网络通过标准反向传播端到端从零开始训练,无需在ImageNet上进行任何预训练。
  • 通过跳跃连接融合来自不同流的特征图,以结合细粒度细节与上下文理解。
  • 该架构通过允许跨尺度的灵活互连,实现了对U-Net、全卷积网络和残差网络的泛化。

实验结果

研究问题

  • RQ1在不进行预训练的情况下,多分辨率、网格结构的CNN架构是否能优于标准的全卷积网络?
  • RQ2通过残差连接整合高分辨率与低分辨率流对分割精度有何影响?
  • RQ3基于网格的架构在多大程度上能泛化U-Net和ResNet等现有架构用于语义分割?
  • RQ4改变流的数量和列的数量对性能和训练复杂度有何影响?

主要发现

  • 当从零开始训练时,GridNet在Cityscapes验证集上实现了69.45%的平均交并比(mIoU),优于多个全卷积基线模型。
  • 增加流的数量可提升性能,最佳结果(69.45% mIoU)在使用12列和7个流(8, 16, 32, 64, 128, 256, 512个特征图)时达到。
  • 在不增加流数量的前提下增加列数无法提升性能,反而增加训练复杂度,表明流的数量比列数更具决定性。
  • 该网络泛化能力良好,在未使用ImageNet预训练的情况下,性能可与FRRN和RefineNet等最先进模型相媲美。
  • 采用交错上下采样列的替代架构性能略低(66.8% mIoU),表明更结构化的列布局更为有效。
  • GridNet表明,从零开始训练即可获得优异结果,提示若采用更好的初始化方法(如在ADE20K上预训练),性能有望进一步提升。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。