Skip to main content
QUICK REVIEW

[论文解读] Scene Parsing with Global Context Embedding

Wei-Chih Hung, Yi‐Hsuan Tsai|arXiv (Cornell University)|Oct 17, 2017
Multimodal Machine Learning Applications参考文献 27被引用 15
一句话总结

本文提出了一种场景解析方法,通过使用孪生网络进行无监督场景相似性学习,并引入两种新型编码模块——全局上下文特征编码与非参数先验编码,以嵌入全局上下文信息,从而提升语义分割性能。该方法通过减少误报,提高了分割精度,在MIT ADE20K和PASCAL Context数据集上实现了最先进性能,相较于基线方法,mIoU最高提升了4.43%。

ABSTRACT

We present a scene parsing method that utilizes global context information based on both the parametric and non- parametric models. Compared to previous methods that only exploit the local relationship between objects, we train a context network based on scene similarities to generate feature representations for global contexts. In addition, these learned features are utilized to generate global and spatial priors for explicit classes inference. We then design modules to embed the feature representations and the priors into the segmentation network as additional global context cues. We show that the proposed method can eliminate false positives that are not compatible with the global context representations. Experiments on both the MIT ADE20K and PASCAL Context datasets show that the proposed method performs favorably against existing methods.

研究动机与目标

  • 解决现有场景解析方法仅依赖局部上下文所导致的在沙地或墙壁等模糊区域出现误报的问题。
  • 通过在推理阶段不依赖场景类别标签的方式,引入全局场景上下文信息,以提升分割精度。
  • 开发一种高效且可扩展的方法,结合参数化与非参数化上下文建模,以提升在罕见与常见类别上的泛化能力。
  • 在不改变现有全卷积网络(FCN)架构的前提下,将全局上下文线索高效集成到现有分割网络中,计算开销极低。

提出的方法

  • 采用无监督方式训练孪生网络,通过比较图像对的场景相似性来学习全局上下文表征,重点关注罕见物体与表面类别。
  • 全局上下文特征编码将学习到的表征作为额外上下文线索,传播至分割网络中。
  • 非参数先验编码通过预计算的紧凑特征检索相似图像,并从检索到的图像中生成全局与空间先验。
  • 先验生成过程采用K=5的最近邻搜索,并结合50×50的空间网格,以高效编码具有空间感知能力的上下文信息。
  • 该方法将参数化特征编码与非参数化先验编码无缝集成到基于FCN的网络(如FCN-8s和DeepLab)中,无需修改网络架构。
  • 检索过程在图像级别进行,利用预计算特征,相比以往非参数方法在像素或超像素级别匹配,显著降低了计算成本。

实验结果

研究问题

  • RQ1无监督的全局上下文表征学习是否能通过建模多样化图像间的场景相似性,有效提升场景解析性能?
  • RQ2所学习的全局上下文特征与非参数先验的融合,在减少模糊区域中的误报预测方面效果如何?
  • RQ3所提方法在MIT ADE20K等复杂数据集中的常见与罕见语义类别上是否具备良好的泛化能力?
  • RQ4该全局上下文嵌入方法能否以极低推理开销,高效应用于现有最先进分割网络?

主要发现

  • 在MIT ADE20K数据集上,当同时使用特征编码与先验编码时,该方法相较于DeepLab基线模型,mIoU提升了4.43%。
  • 仅使用先验编码时,该方法在FCN-8s上提升了3.53%的mIoU,在DeepLab上提升了3.42%的mIoU,显示出显著的性能增益。
  • 对于罕见类别,该方法实现了4.64%的mIoU提升,表明其对低频语义类别具有有效处理能力。
  • 在PASCAL Context数据集上,该方法取得了46.52%的mIoU与73.80%的像素准确率,优于包括CRF-RNN与HO_CRF在内的最先进方法。
  • 该方法通过强制实现全局场景一致性,显著减少了在模糊区域的误报,例如在海滩场景中将沙地错误分类为山脉的情况。
  • 单张图像的推理时间为1.4秒(GPU上),其中先验编码模块仅引入0.7秒的额外开销,展现出良好的计算效率。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。