Skip to main content
QUICK REVIEW

[论文解读] Improved Techniques For Weakly-Supervised Object Localization

Junsuk Choe, Joo Hyun Park|arXiv (Cornell University)|Feb 22, 2018
Advanced Neural Network Applications参考文献 27被引用 5
一句话总结

本文提出了一种改进的弱监督目标定位(WSOL)方法,采用GoogLeNet Resize(GR)数据增强和优化的训练设置,在最先进方法的基础上将Top-1定位准确率提升了21.4–37.3%。该方法通过激进地裁剪和重缩放输入图像,增强了对判别性较低的物体部分的特征学习能力,同时更小的批量大小和更深的网络结构进一步提升了性能,超越了现有方法。

ABSTRACT

We propose an improved technique for weakly-supervised object localization. Conventional methods have a limitation that they focus only on most discriminative parts of the target objects. The recent study addressed this issue and resolved this limitation by augmenting the training data for less discriminative parts. To this end, we employ an effective data augmentation for improving the accuracy of the object localization. In addition, we introduce improved learning techniques by optimizing Convolutional Neural Networks (CNN) based on the state-of-the-art model. Based on extensive experiments, we evaluate the effectiveness of the proposed approach both qualitatively and quantitatively. Especially, we observe that our method improves the Top-1 localization accuracy by 21.4 - 37.3% depending on configurations, compared to the current state-of-the-art technique of the weakly-supervised object localization.

研究动机与目标

  • 为解决传统WSOL方法仅定位物体最具判别性的部分,导致边界框覆盖不完整的问题。
  • 通过引入比现有方法(如Hide-and-Seek,HnS)更激进的数据增强技术,提升定位准确率。
  • 研究批量大小和网络深度对WSOL性能的影响,优化训练配置以实现更好的泛化能力。
  • 证明GR增强优于HnS,并且将GR与更小批量大小和更深网络结合可获得更优的定位结果。

提出的方法

  • 提出GoogLeNet Resize(GR)作为新型数据增强技术,通过随机裁剪图像块并将其重缩放至原始输入尺寸,增加训练多样性,迫使模型从判别性较低的部分学习特征。
  • 采用在Tiny ImageNet上使用图像级别标签训练的预激活ResNet架构,利用类激活映射(CAM)生成定位热力图。
  • 通过系统评估批量大小(32、128、256)和网络深度(18层和34层)对定位性能的影响,优化训练过程。
  • 对CAM热力图进行后处理以生成边界框,从而可与基线方法和最先进方法直接比较。
  • 开展消融研究以评估GR与HnS的相互作用,发现二者互斥,且仅使用GR时性能最佳。
  • 采用在256批量和18层设置下调优的固定超参数配置,随后在不同批量大小和深度下评估泛化性能。

实验结果

研究问题

  • RQ1GoogLeNet Resize(GR)数据增强在弱监督目标定位中是否优于最先进方法Hide-and-Seek(HnS)?
  • RQ2批量大小如何影响基于CAM的弱监督模型的定位准确率?
  • RQ3在相同训练协议下,增加网络深度(如从18层增至34层)是否能提升定位性能?
  • RQ4GR与HnS是否具有互补性,还是由于数据增强策略冲突导致联合使用会降低性能?

主要发现

  • 在批量大小256和ResNet34设置下,GoogLeNet Resize(GR)达到36.00%的Top-1定位准确率,优于HnS(29.72%)和CAM(27.50%),提升幅度达21.4–37.3%不等。
  • 与HnS相比,所提方法将GT已知定位准确率提升7%,Top-1定位准确率提升25%,在ResNet34上取得最佳结果57.82%。
  • 更小的批量大小(如32)在所有方法中均使性能提升10–15%,表明减小批量大小可增强WSOL中的泛化能力。
  • 更深的网络(34层)相比浅层网络(18层)获得更高的定位准确率,在批量大小32和ResNet18上达到35.94%的Top-1 Loc结果。
  • 同时应用HnS与GR会降低性能,表明二者互斥,且仅使用GR时表现更优。
  • 定性结果表明,GR生成的热力图能更完整地覆盖物体,并且与真实边界框的对齐度优于CAM或HnS。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。