Skip to main content
QUICK REVIEW

[论文解读] Image-Level or Object-Level? A Tale of Two Resampling Strategies for Long-Tailed Detection

Nadine Chang, Zhiding Yu|arXiv (Cornell University)|Apr 12, 2021
Domain Adaptation and Few-Shot Learning参考文献 28被引用 5
一句话总结

本文提出RIO,一种用于长尾目标检测的图像级与目标级联合重采样策略,结合重复因子采样(RFS)与以目标为中心的内存回放机制,重用前序模型更新中的RoI特征。RIO在LVIS v0.5和v1.0上达到最先进性能,在检测任务中将稀有类别AP提升36.4%,在分割任务中提升29.9%,同时保持整体准确率不变。

ABSTRACT

Training on datasets with long-tailed distributions has been challenging for major recognition tasks such as classification and detection. To deal with this challenge, image resampling is typically introduced as a simple but effective approach. However, we observe that long-tailed detection differs from classification since multiple classes may be present in one image. As a result, image resampling alone is not enough to yield a sufficiently balanced distribution at the object level. We address object-level resampling by introducing an object-centric memory replay strategy based on dynamic, episodic memory banks. Our proposed strategy has two benefits: 1) convenient object-level resampling without significant extra computation, and 2) implicit feature-level augmentation from model updates. We show that image-level and object-level resamplings are both important, and thus unify them with a joint resampling strategy (RIO). Our method outperforms state-of-the-art long-tailed detection and segmentation methods on LVIS v0.5 across various backbones. Code is available at https://github.com/NVlabs/RIO.

研究动机与目标

  • 解决长尾目标检测中图像级重采样存在的局限性,即图像中存在多个类别时导致的目标级分布不平衡问题。
  • 开发一种高效的基于目标的重采样策略,避免训练过程中增加前向/反向传播次数。
  • 通过模型更新和目标提议中的时间多样性,实现隐式的特征级增强。
  • 将图像级与目标级重采样统一为协同框架,在不降低整体准确率的前提下提升稀有类别性能。
  • 在LVIS这一具有挑战性的长尾检测与实例分割基准上实现最先进结果。

提出的方法

  • 引入一种以目标为中心的内存回放框架,存储并重用前序前向传播中的RoI特征与边界框坐标。
  • 维护一个大小有限、动态更新的类别特定内存库,每轮训练迭代通过推入新特征并淘汰旧特征来更新。
  • 在训练期间从内存库中采样额外的稀有目标提议,以平衡目标级分布,且无需额外模型推理。
  • 利用模型更新与数据增强实现隐式的特征级增强,提升目标表征的多样性。
  • 将内存回放策略与图像级的重复因子采样(RFS)相结合,形成联合重采样策略(RIO),以同时解决图像级与目标级的不平衡问题。
  • 采用加权采样策略,优先选择训练样本少于30个的类别,以最大化内存回放的收益。

实验结果

研究问题

  • RQ1当图像级重采样因多类别图像而不足以改善长尾检测性能时,目标级重采样是否能提升性能?
  • RQ2与简单的特征重复相比,以目标为中心的内存回放在模型泛化能力与性能方面表现如何?
  • RQ3从内存库中采样多少个目标提议可实现稀有、常见与频繁类别之间的性能平衡?
  • RQ4图像级重采样与目标级重采样能否有效结合,实现协同增益?
  • RQ5内存回放是否能通过模型演化与目标提议的时间多样性,提供有意义的特征级增强?

主要发现

  • 在LVIS v0.5检测任务中,RIO使稀有类别AP相对提升36.4%,显著优于RFS及其他基线方法。
  • 在LVIS v1.0上,RIO在检测任务中将稀有类别AP从14.8提升至18.6(+18.6),在实例分割任务中从15.4提升至18.8(+18.8),使用ResNeXt-101骨干网络。
  • 从内存库中采样20个目标提议为最优数量,可在提升稀有类别性能与保持常见/频繁类别稳定性之间实现平衡。
  • 仅重复RoI特征而不使用内存回放会导致性能持续下降,证明了内存回放带来的时序多样性与特征多样性至关重要。
  • RIO在显著提升稀有类别检测性能的同时,保持了较高的整体AP,表明在长尾识别中公平性与准确性可共存。
  • 该方法兼容多种骨干网络(包括ResNeXt-101),并在多个基准与设置下一致提升性能。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。