[论文解读] Learning High-level Prior with Convolutional Neural Networks for Semantic Segmentation
该论文提出了一种条件变分自编码器(CVAE),通过建模三层生成结构——高层编码、中层分割和底层图像——将高层全局先验融入语义分割。通过使用图像和分割编码器以及混合解码器训练CVAE,该方法提升了全局一致性,并在多个数据集上实现了最先进性能,优于FCN和FCN+CRF基线方法。
This paper proposes a convolutional neural network that can fuse high-level prior for semantic image segmentation. Motivated by humans' vision recognition system, our key design is a three-layer generative structure consisting of high-level coding, middle-level segmentation and low-level image to introduce global prior for semantic segmentation. Based on this structure, we proposed a generative model called conditional variational auto-encoder (CVAE) that can build up the links behind these three layers. These important links include an image encoder that extracts high level info from image, a segmentation encoder that extracts high level info from segmentation, and a hybrid decoder that outputs semantic segmentation from the high level prior and input image. We theoretically derive the semantic segmentation as an optimization problem parameterized by these links. Finally, the optimization problem enables us to take advantage of state-of-the-art fully convolutional network structure for the implementation of the above encoders and decoder. Experimental results on several representative datasets demonstrate our supreme performance for semantic segmentation.
研究动机与目标
- 解决全卷积网络(FCNs)因感受野局部化而导致全局语义分割不一致的局限性。
- 受人类视觉感知启发,将对象形状和场景上下文等高层语义先验融入基于深度学习的分割方法中。
- 开发一种生成模型,从像素级分割标注中学习全局特征,而无需额外监督。
- 实现端到端训练深度网络,联合优化全局结构与局部细节,以提升分割精度。
提出的方法
- 提出一种三层条件变分自编码器(CVAE),包含用于高层编码(z)、中层分割(s)和观测图像(x)的潜在变量,建模联合分布p(x, s, z)。
- 设计一种结构化CVAE,其中先采样z,然后在z条件下生成s,最后在s条件下生成x,模拟人类视觉识别过程。
- 使用图像编码器从输入图像中提取高层特征,使用分割编码器从真实分割中提取高层特征,并使用混合解码器结合图像和先验特征进行分割重建。
- 推导变分下界(ELBO)作为训练目标,通过自编码框架实现端到端反向传播优化。
- 采用最先进全卷积网络(FCN)架构作为编码器和解码器,实现高效且精确的特征学习。
- 通过数据增强(翻转、小幅度位移)和模型容量缩减防止图像编码器过拟合,提升全局先验的泛化能力。
实验结果
研究问题
- RQ1深度生成模型能否在无额外监督的情况下,从像素级分割标注中有效学习高层语义先验?
- RQ2与纯局部、基于补丁的方法相比,高层全局上下文在多大程度上能提升语义分割的一致性和准确性?
- RQ3CVAE架构在语义分割任务中,相较于标准FCN和FCN+CRF流程,能多大程度上实现性能超越?
- RQ4图像编码器学习的全局先验是否比分割编码器学习的先验在塑造最终分割输出方面更有效?
主要发现
- 在PASCAL VOC 2012数据集上,所提出的HR网络达到80.2%的平均交并比(mIoU),优于基线FCN和FCN+CRF方法。
- 在Penn-Fudan行人数据集上,HR网络达到91.61%的平均像素准确率,经密集CRF后处理后提升至92.37%,超过MMBM+GraphCut基线。
- 图像编码器的全局先验主导最终分割形状,表明图像编码器学习到的高层特征比分割编码器更具鲁棒性和泛化能力。
- 即使不使用局部特征,仅靠高层编码也能重建出一般物体形状,证明了全局先验的有效性。
- 当通过容量缩减和数据增强对图像编码器进行正则化时,该方法对过拟合仍具鲁棒性,显示出更好的泛化能力。
- 将所提出的CVAE与基于CRF的后处理结合可进一步提升性能,证实了全局与局部建模的互补性。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。