Skip to main content
QUICK REVIEW

[論文レビュー] Adaptive Class Suppression Loss for Long-Tail Object Detection

Tong Wang, Yousong Zhu|arXiv (Cornell University)|Apr 2, 2021
Domain Adaptation and Few-Shot Learning参考文献 36被引用数 4
ひとこと要約

本稿では、学習状態に応じて各クラスごとに負の勾配の抑制を動的に調整することで、長尾物体検出におけるクラスの不均衡を緩和する統計フリーで適応的な損失関数、Adaptive Class Suppression Loss (ACSL) を提案する。ACSL は手動によるヘッド/テイルグループ分けを不要とし、レアクラスおよび意味的に類似したカテゴリの識別性を向上させ、ResNet50-FPN を用いた LVIS および Open Images でそれぞれ 5.18% および 5.2% の mAP 向上を達成し、最先端の性能を実現する。

ABSTRACT

To address the problem of long-tail distribution for the large vocabulary object detection task, existing methods usually divide the whole categories into several groups and treat each group with different strategies. These methods bring the following two problems. One is the training inconsistency between adjacent categories of similar sizes, and the other is that the learned model is lack of discrimination for tail categories which are semantically similar to some of the head categories. In this paper, we devise a novel Adaptive Class Suppression Loss (ACSL) to effectively tackle the above problems and improve the detection performance of tail categories. Specifically, we introduce a statistic-free perspective to analyze the long-tail distribution, breaking the limitation of manual grouping. According to this perspective, our ACSL adjusts the suppression gradients for each sample of each class adaptively, ensuring the training consistency and boosting the discrimination for rare categories. Extensive experiments on long-tail datasets LVIS and Open Images show that the our ACSL achieves 5.18% and 5.2% improvements with ResNet50-FPN, and sets a new state of the art. Code and models are available at https://github.com/CASIA-IVA-Lab/ACSL.

研究の動機と目的

  • インスタンス頻度に基づく手動によるカテゴリグループ分けに依存する従来の長尾検出手法の限界を解消すること。
  • 類似したインスタンス数を持つ隣接カテゴリ間で、グループ割り当てが異なることによる学習の不整合を解消すること。
  • 視覚的に類似したが頻度が異なるカテゴリ間の特徴の識別性を向上させること。
  • 統計的特徴を必要とせず、適応的な学習戦略を導入することで、データリウェイトやヒューリスティックなハイパーパrameterの必要性を排除すること。
  • ヘッドクラスの性能を損なうことなく、特にレアクラスにおいて一貫した性能向上を達成すること。

提案手法

  • すべてのカテゴリを潜在的にレアとみなす統計フリーな長尾分布の見方を提案し、任意のヘッド/テイル分割を回避する。
  • 現在の学習状態に応じて各クラスごとに負の勾配の流れを調整する適応的勾配抑制機構を設計する。
  • 各クラスごとに学習可能な抑制要因を導入し、負の勾配をスケーリングすることで、テイル分類器の過剰な抑制を防ぐ。
  • 標準的な Faster R-CNN や RetinaNet スタイルの検出ヘッド内に損失を適用し、既存のアーキテクチャとシームレスに統合する。
  • 全体の抑制強度を制御するための単一のハイパーパrameter ξ を使用し、検証セット上で経験的に調整する。
  • 標準的な最適化手法を用いてエンドツーエンドで学習させ、モデルがすべてのカテゴリ間で学習ダイナミクスを自己調整できるようにする。

実験結果

リサーチクエスチョン

  • RQ1長尾検出において、手動によるカテゴリグループ分けを不要にするような損失関数を設計できるか?
  • RQ2同じ頻度を持つカテゴリが異なるグループに割り当てられた場合に生じる学習の不整合をどのように軽減できるか?
  • RQ3視覚的に類似しているが頻度が異なるカテゴリ間の識別力は、維持または強化できるか?
  • RQ4学習状態に応じた適応的抑制機構は、固定またはグループベースの勾配処理に比べ、長尾設定で優れた性能を発揮するか?
  • RQ5統計的特徴を必要としない損失関数は、データリウェイトやリサンプリングを伴わずに、ヘッドクラスおよびテイルクラスの両方で一貫した性能向上を達成できるか?

主な発見

  • LVIS データセットにおいて、ResNet50-FPN を用いた場合、ACSL はベースライン比で 5.18% の mAP 向上を達成し、新たな最先端性能を樹立した。
  • Open Images では、ResNet50-FPN を用いた場合、ベースライン比で 5.2% の mAP 向上を達成し、ResNet152-FPN を用いた場合 62.8% の mAP を達成した。
  • 「アイマスク」や「フェイスパウダー」などのレアカテゴリでは、それぞれ最大 63.1% の AP 向上を達成し、強力なレアクラス一般化性能を示した。
  • マルチスケールテストを適用した場合、最良のモデルは LVIS で 29.47% の mAP を達成し、Equalization Loss や BAGS を大きく上回った。
  • Open Images では、Class Aware Sampling や Equalization Loss よりも優れた性能を示し、61.70% の AP を達成した(Equalization Loss は 57.83%)。
  • 本手法はすべてのカテゴリで強力な性能を維持しており、ヘッドクラスおよびテイルクラスの両方で一貫した向上が見られ、学習の一貫性と識別性の向上が示された。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。