[论文解读] Learning Transferrable Knowledge for Semantic Segmentation with Deep Convolutional Neural Network
本文提出了一种弱监督语义分割方法,通过仅使用图像级别标签,将60个COCO类别中的分割知识迁移至PASCAL VOC 2012,以提升性能。该方法引入了一种解耦的编码器-解码器架构,结合注意力机制生成类别特定的显著性图,使解码器能够跨类别利用分割知识,实现了在极少弱监督信号下的最先进性能。
We propose a novel weakly-supervised semantic segmentation algorithm based on Deep Convolutional Neural Network (DCNN). Contrary to existing weakly-supervised approaches, our algorithm exploits auxiliary segmentation annotations available for different categories to guide segmentations on images with only image-level class labels. To make the segmentation knowledge transferrable across categories, we design a decoupled encoder-decoder architecture with attention model. In this architecture, the model generates spatial highlights of each category presented in an image using an attention model, and subsequently generates foreground segmentation for each highlighted region using decoder. Combining attention model, we show that the decoder trained with segmentation annotations in different categories can boost the performance of weakly-supervised semantic segmentation. The proposed algorithm demonstrates substantially improved performance compared to the state-of-the-art weakly-supervised techniques in challenging PASCAL VOC 2012 dataset when our model is trained with the annotations in 60 exclusive categories in Microsoft COCO dataset.
研究动机与目标
- 通过利用不同类别上的分割注释,缩小弱监督与全监督语义分割之间的性能差距。
- 解决在弱标签数据(图像级别标签)上训练时,跨类别迁移分割知识的挑战。
- 设计一种模型架构,实现在无需目标数据集像素级注释的情况下,有效从源类别(如COCO)向目标类别(如PASCAL VOC)迁移知识。
- 通过利用无关类别的辅助分割数据,在低监督设置下提升分割准确率。
- 证明注意力机制引导的特征突出能够比直接特征传播更有效地实现语义类别间分割知识的泛化。
提出的方法
- 设计一种解耦的编码器-解码器架构,其中编码器处理输入图像,解码器生成分割掩码。
- 引入一个注意力模块,通过聚焦于每个类别相关的空间区域,生成类别特定的显著性图。
- 使用60个COCO类别的分割注释训练解码器,以学习可泛化的分割模式。
- 将注意力图用作解码器的动态引导,使其在推理阶段即使面对未见类别也能关注相关区域。
- 采用全卷积网络(FCN)主干网络进行特征提取,并将最终的分类得分图作为注意力机制的输入。
- 应用条件随机场(CRF)作为后处理步骤,以优化分割边界,提升定位精度。
实验结果
研究问题
- RQ1能否有效将一组类别(如COCO)中的分割知识迁移至另一组类别(如PASCAL VOC)上,以仅使用图像级别标签实现弱监督语义分割?
- RQ2与直接特征传播相比,注意力机制引导的特征突出如何提升分割知识在类别间的可迁移性?
- RQ3源注释数量在多大程度上影响弱监督语义分割模型在目标数据集上的性能?
- RQ4在未进行微调或额外注释的情况下,是否能够使在多样化源类别上训练的模型泛化至未见的目标类别?
- RQ5与基线弱监督方法相比,所提方法在分割准确率和对噪声或错误图像级别标签的鲁棒性方面表现如何?
主要发现
- 所提方法仅使用图像级别标签和60个COCO类别的分割注释,就在PASCAL VOC 2012基准上实现了最先进性能。
- 该模型优于缺乏注意力机制的基线方法(如DecoupledNet†和BaselineNet),证明了空间注意力在知识迁移中的关键作用。
- 即使仅使用1%的COCO注释,模型性能仍优于现有弱监督方法,表明其具有极高的数据效率。
- 注意力图提供的表示比BaselineNet中使用的稀疏类别得分图更密集、更具信息量,从而生成更准确、更完整的分割结果。
- CRF后处理的引入进一步提升了分割质量,尤其在优化物体边界方面效果显著。
- 该方法对误分类和噪声注意力输出具有鲁棒性,尽管在极少数情况下仍可能导致预测不准确。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。