Skip to main content
QUICK REVIEW

[论文解读] Learning Dense Convolutional Embeddings for Semantic Segmentation

Adam W. Harley, Konstantinos G. Derpanis|arXiv (Cornell University)|Nov 13, 2015
Advanced Neural Network Applications参考文献 31被引用 18
一句话总结

本文提出一种深度卷积神经网络,通过建模像素之间的语义亲和力来学习密集的像素嵌入,从而提升语义分割性能。通过使用这些嵌入,以学习到的、类似卷积的层对预测结果进行过滤和重加权,该方法在PASCAL VOC 2012上将准确率最高提升了1.2%,优于RGB距离、手工设计的嵌入以及遮挡轮廓,且计算开销极低。

ABSTRACT

This paper proposes a new deep convolutional neural network (DCNN) architecture that learns pixel embeddings, such that pairwise distances between the embeddings can be used to infer whether or not the pixels lie on the same region. That is, for any two pixels on the same object, the embeddings are trained to be similar; for any pair that straddles an object boundary, the embeddings are trained to be dissimilar. Experimental results show that when this embedding network is used in conjunction with a DCNN trained on semantic segmentation, there is a systematic improvement in per-pixel classification accuracy. Our contributions are integrated in the popular Caffe deep learning framework, and consist in straightforward modifications to convolution routines. As such, they can be exploited for any task involving convolution layers.

研究动机与目标

  • 通过学习编码像素间语义相似性的密集像素嵌入,提升语义分割的准确性。
  • 实现在DCNN中对像素亲和力进行在线、密集计算,取代手工设计或预计算的亲和度度量。
  • 将学习到的嵌入作为高效、可微分的层集成到现有DCNN流水线中,实现端到端训练。
  • 证明学习到的嵌入能够锐化分割预测结果,特别是在物体边界处,且在嵌入训练过程中无需像素级标签。
  • 提供一种即插即用的模块,兼容Caffe等主流框架,适用于任何基于DCNN的视觉任务。

提出的方法

  • 该方法训练一个DCNN,为每个像素生成密集的高维嵌入,使得同一物体上像素的嵌入在嵌入空间中彼此接近。
  • 利用像素嵌入之间的成对距离作为学习到的亲和度分数,判断两个像素是否属于同一语义区域。
  • 通过空间局部滤波操作,将这些亲和度作为权重,对最后一层激活值进行重加权,从而有效聚合来自相似邻近像素的预测结果。
  • 嵌入层在Caffe中实现为可微分的、类似卷积的操作,支持在有或无像素级标注的情况下进行端到端训练。
  • 该方法支持递归应用滤波器,以扩展有效感受野,提升长距离上下文建模能力。
  • 该方法可与DeepLab等现有分割模型集成,并可与CRF后处理结合以获得进一步性能提升。

实验结果

研究问题

  • RQ1通过建模局部语义亲和力,学习到的密集像素嵌入能否提升语义分割的准确性?
  • RQ2与RGB距离或遮挡轮廓等手工设计的亲和度相比,学习到的嵌入性能如何?
  • RQ3将学习到的嵌入集成到DCNN流水线中,是否能在不同网络架构和数据集上实现一致的性能提升?
  • RQ4为最大化分割准确性,最优的滤波器尺寸和递归应用次数是多少?
  • RQ5该嵌入模块是否可在无需像素级标签进行嵌入学习的情况下,有效应用于端到端训练流水线?

主要发现

  • 与基线DeepLab模型相比,所提方法在PASCAL VOC 2012测试集上的平均交并比(mIoU)提升了1.2%。
  • 表现最佳的配置采用9×9的嵌入滤波器,递归应用七次,验证集上达到79.69%的mIoU。
  • 当与密集CRF结合时,嵌入增强型模型在测试集上达到74.00%的mIoU,比DeepLab-CRF基线高出0.4%。
  • 更大的滤波器尺寸(最大达15×15)以及多次递归应用均能持续提升性能,证实了扩大感受野的优势。
  • 尽管内存占用极小,学习到的嵌入仍优于最先进的手工设计嵌入(如Leordeanu等人提出的方法)和遮挡轮廓。
  • 该方法与现有技术(如CRF后处理和反卷积上采样)正交,结合使用可实现互补性增益。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。