[论文解读] Bottom-Up Top-Down Cues for Weakly-Supervised Semantic Segmentation
本论文提出了一种仅使用图像级别标签的弱监督语义分割方法,通过利用自底向上的显著性图和自顶向下的注意力图,为基于EM的训练框架提供一种高效初始化。该方法在PASCAL VOC 2012上实现了最先进性能,相比之前方法大幅领先——mIoU最高提升10%,且无需边界框、草图或CRF后处理。
We consider the task of learning a classifier for semantic segmentation using weak supervision in the form of image labels which specify the object classes present in the image. Our method uses deep convolutional neural networks (CNNs) and adopts an Expectation-Maximization (EM) based approach. We focus on the following three aspects of EM: (i) initialization; (ii) latent posterior estimation (E-step) and (iii) the parameter update (M-step). We show that saliency and attention maps, our bottom-up and top-down cues respectively, of simple images provide very good cues to learn an initialization for the EM-based algorithm. Intuitively, we show that before trying to learn to segment complex images, it is much easier and highly effective to first learn to segment a set of simple images and then move towards the complex ones. Next, in order to update the parameters, we propose minimizing the combination of the standard softmax loss and the KL divergence between the true latent posterior and the likelihood given by the CNN. We argue that this combination is more robust to wrong predictions made by the expectation step of the EM method. We support this argument with empirical and visual results. Extensive experiments and discussions show that: (i) our method is very simple and intuitive; (ii) requires only image-level labels; and (iii) consistently outperforms other weakly-supervised state-of-the-art methods with a very high margin on the PASCAL VOC 2012 dataset.
研究动机与目标
- 解决仅使用最小监督信号(特别是仅图像级别标签而非像素级标注)进行语义分割的挑战。
- 克服现有弱监督方法依赖更高阶监督信号(如边界框、点或超像素)的局限性。
- 通过先从简单图像学习,再处理复杂多目标场景,提升模型泛化能力和收敛性。
- 在M-step中设计一种鲁棒的参数更新策略,结合交叉熵损失与KL散度,以缓解E-step预测错误带来的影响。
提出的方法
- 利用来自简单ImageNet图像的类别无关显著性图(自底向上)和类别相关注意力图(自顶向下),生成伪真实标签掩码,用于初始模型训练。
- 在仅包含单个物体的ImageNet图像子集上,使用显著性图与注意力图的联合监督,训练初始语义分割模型。
- 应用期望最大化(EM)框架:在E-step中,通过图像级别类别标签正则化CNN似然,将概率质量限制在实际存在的类别与背景上。
- 在M-step中,最小化一种混合损失,结合标准交叉熵损失与估计的隐变量后验分布和CNN似然之间的KL散度,以提升鲁棒性。
- 避免使用CRF后处理,以保持完全弱监督;相反,采用仅依赖图像标签的端到端训练。
- 通过多轮EM迭代,从有信息的初始化开始,逐步优化预测,从而提升在PASCAL VOC 2012上的分割精度。
实验结果
研究问题
- RQ1是否可以通过显著性图与注意力图实现简单且数据高效的初始化,显著提升弱监督语义分割的性能?
- RQ2结合自底向上与自顶向下线索是否能提供比单独使用任一线索更优的伪真实标签监督?
- RQ3在E-step预测存在噪声的情况下,基于EM的框架若采用混合M-step损失(交叉熵+KL散度),是否能优于仅使用标准交叉熵的训练?
- RQ4是否可能仅使用图像级别标签,在不依赖CRF或更高阶监督信号的前提下,实现在PASCAL VOC 2012上的最先进性能?
- RQ5先在简单图像上进行训练,如何提升弱监督语义分割中的泛化能力与收敛性?
主要发现
- 所提方法在PASCAL VOC 2012测试集上达到72.1%的平均交并比(mIoU),相比之前最先进方法(AugFeed)提升近10个百分点。
- 即使不使用CRF后处理,该方法在测试集上仍比现有最佳方法(使用CRF和更高阶监督)高出2.2%。
- 仅在简单ImageNet图像上训练的初始模型,其性能已优于所有当前最先进方法,证明了先从简单图像学习的有效性。
- 显著性图与注意力图的结合生成的伪真实标签比单独使用任一图更准确,视觉对比与定量分析均验证了这一点。
- 混合M-step损失(交叉熵+KL散度)能有效提升对错误E-step预测的鲁棒性,尤其在类别混淆或模糊的情况下表现更优。
- 该方法保持完全弱监督,仅需图像级别标签,无需边界框、草图或像素级标注,因此在大规模数据场景下具备良好的可扩展性与实用性。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。