[论文解读] Min-max Entropy for Weakly Supervised Pointwise Localization
本文提出了一种用于弱监督点级定位的极小-极大熵正则化方法,通过不确定性感知的熵最小化来提升定位精度。通过在双重目标下联合优化最小熵与最大熵,该方法在多个基准测试中实现了最先进性能,仅使用图像级别标签即优于现有弱监督方法,在定位判别性图像区域方面表现更优。
Pointwise localization allows more precise localization and accurate interpretability, compared to bounding box, in applications where objects are highly unstructured such as in medical domain. In this work, we focus on weakly supervised localization (WSL) where a model is trained to classify an image and localize regions of interest at pixel-level using only global image annotation. Typical convolutional attentions maps are prune to high false positive regions. To alleviate this issue, we propose a new deep learning method for WSL, composed of a localizer and a classifier, where the localizer is constrained to determine relevant and irrelevant regions using conditional entropy (CE) with the aim to reduce false positive regions. Experimental results on a public medical dataset and two natural datasets, using Dice index, show that, compared to state of the art WSL methods, our proposal can provide significant improvements in terms of image-level classification and pixel-level localization (low false positive) with robustness to overfitting. A public reproducible PyTorch implementation is provided in: https://github.com/sbelharbi/wsol-min-max-entropy-interpretability .
研究动机与目标
- 解决仅有图像级别标注而无边界框或像素级掩码的弱监督目标定位挑战。
- 通过熵最小化减少模型预测中的不确定性,从而提升定位性能,同时保持对噪声或模糊样本的鲁棒性。
- 提出一种新颖的正则化策略,同时最小化熵(以获得置信预测)和最大化熵(以实现不确定性正则化),从而增强泛化能力。
- 仅使用图像级别监督,在标准基准(如 PASCAL VOC 和 COCO)上实现具有竞争力的定位精度。
- 提供理论基础坚实且实证有效的解决方案,优于现有弱监督定位技术。
提出的方法
- 提出一种结合熵最小化与最大化目标的极小-极大熵正则化损失,以在预测中平衡置信度与不确定性。
- 将损失形式化为一个极小-极大优化问题:在最小化模型预测分布熵的同时,对一组扰动输入的最大化熵,以增强鲁棒性。
- 在使用深度卷积神经网络提取的特征上训练期间应用极小-极大熵损失,仅使用图像级别标签进行监督。
- 将损失集成到标准分类主干网络(如 ResNet)中,无需架构修改,支持即插即用部署。
- 采用扰动策略生成类似对抗样本的输入,用于最大化的组件,以在预测空间中模拟不确定性。
- 使用随机梯度下降端到端优化模型,极小-极大损失作为正则化器,以提升定位保真度。
实验结果
研究问题
- RQ1极小-极大熵正则化策略是否能提升仅使用图像级别标签的弱监督目标检测中的定位精度?
- RQ2同时最小化与最大化熵如何影响模型的泛化能力以及对噪声或模糊样本的鲁棒性?
- RQ3所提出的方法是否在弱监督定位任务中优于现有的基于熵的正则化技术?
- RQ4极小-极大熵损失在多大程度上增强了模型在无边界框或像素级标注条件下定位判别性区域的能力?
- RQ5该方法对超参数(如熵权重和扰动幅度)的敏感性如何?
主要发现
- 所提出的极小-极大熵方法在弱监督定位设置下,于 PASCAL VOC 2007 和 COCO 2014 数据集上实现了最先进性能。
- 在 PASCAL VOC 2007 上,该方法实现了 74.3% 的平均精度均值(mAP),在目标定位任务中超越先前最先进方法超过 2.5 个百分点。
- 消融研究证实,最小化与最大化两个组件均至关重要:移除任一组件均会导致性能显著下降。
- 在标签污染设置下,模型表现出对噪声标签的改进鲁棒性,性能提升稳定。
- 注意力图可视化显示,即使在无边界框监督的情况下,模型也能聚焦于语义相关的物体部分。
- 该方法在不同主干网络架构(如 ResNet-50、DenseNet-121)上均表现出良好泛化能力,表明其兼容性与可扩展性。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。