[论文解读] Rethinking the Route Towards Weakly Supervised Object Localization
本文提出伪监督目标定位(PSOL),一种新颖范式,将弱监督目标定位解耦为与类别无关的定位与分类任务,通过使用如DDT等与类别无关的方法生成的噪声伪边界框,随后进行边界框回归。该方法在ImageNet-1k上达到58.00%的Top-1定位准确率,在CUB-200上达到74.97%,显著优于先前方法,并展现出强大的零样本跨数据集迁移能力。
Weakly supervised object localization (WSOL) aims to localize objects with only image-level labels. Previous methods often try to utilize feature maps and classification weights to localize objects using image level annotations indirectly. In this paper, we demonstrate that weakly supervised object localization should be divided into two parts: class-agnostic object localization and object classification. For class-agnostic object localization, we should use class-agnostic methods to generate noisy pseudo annotations and then perform bounding box regression on them without class labels. We propose the pseudo supervised object localization (PSOL) method as a new way to solve WSOL. Our PSOL models have good transferability across different datasets without fine-tuning. With generated pseudo bounding boxes, we achieve 58.00% localization accuracy on ImageNet and 74.97% localization accuracy on CUB-200, which have a large edge over previous models.
研究动机与目标
- 为解决现有弱监督目标定位(WSOL)方法将分类与定位任务混淆的局限性。
- 证明目标定位可独立于类别标签进行,挑战定位必须依赖类别特定特征的假设。
- 通过使用与类别无关的方法生成噪声伪边界框,并利用端到端边界框回归进行优化,从而提升定位性能。
- 在无需微调的情况下,实现定位模型在不同数据集间的强零样本迁移能力。
- 建立一种新范式——PSOL,将与类别无关的定位与分类分离,从而实现更优的性能与泛化能力。
提出的方法
- 该方法首先使用与类别无关的方法(具体为深度描述符变换DDT)生成噪声伪真实边界框,以避免对类别标签的依赖。
- 随后在这些伪边界框上应用边界框回归头,以优化其位置,实现无需类别特定监督的端到端优化。
- 该方法将定位头与分类头解耦,使可独立使用最先进的分类器(如EfficientNet-B7)与定位头配合。
- 定位模型仅在伪边界框上进行训练,且在定位优化过程中完全不访问真实类别标签,强调与类别无关的学习。
- 该框架支持零样本迁移:在ImageNet-1k上训练的模型无需任何微调即可在CUB-200上实现高性能。
- 该方法兼容多种主干网络(如VGG、DenseNet161),并使用全局平均池化(GAP)或可分离卷积以提升效率与性能。
实验结果
研究问题
- RQ1弱监督目标定位能否被有效解耦为与类别无关的定位任务与独立的分类任务?
- RQ2在无类别标签的情况下,仅在噪声伪边界框上训练定位头,其性能是否优于使用类别特定特征进行端到端优化的方法?
- RQ3在某一数据集(如ImageNet-1k)上训练的定位模型,能否在无微调的情况下有效泛化到另一数据集(如CUB-200)?
- RQ4在定位准确率与迁移能力方面,所提出的PSOL方法相较于SOTA的WSOL与全监督方法表现如何?
- RQ5定位性能在多大程度上独立于分类性能?两者能否在不相互损害的情况下联合优化?
主要发现
- 当与EfficientNet-B7结合时,PSOL在ImageNet-1k上达到58.00%的Top-1定位准确率,显著优于先前SOTA方法。
- 在CUB-200数据集上,PSOL达到74.97%的Top-1定位准确率,远超先前方法。
- 在ImageNet-1k上训练的PSOL模型在CUB-200上实现无微调的高效泛化,达到89.11%的Top-1准确率,表明其具备强大的零样本迁移能力。
- 即使使用更强的主干网络(如DenseNet161),该方法仍优于微调分类权重或整个网络的模型。
- 尽管仅使用图像级标签,PSOL在Top-5定位准确率上仍可媲美全监督模型(如AlexNet)。
- 消融研究证实,与类别无关的定位比联合分类-定位训练更有效,验证了核心范式转变的合理性。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。