Skip to main content
QUICK REVIEW

[論文レビュー] Learning from Rich Semantics and Coarse Locations for Long-tailed Object Detection

Lingchen Meng, Xiyang Dai|arXiv (Cornell University)|Oct 18, 2023
Advanced Neural Network Applications被引用数 4
ひとこと要約

本稿では、画像・テキスト対照モデル(例:CLIP)からの豊富な意味的特徴と、粗い画像レベルのバウンディングボックスをソフトな監視信号として活用することで、長尾分布におけるオブジェクト検出を簡潔かつ効果的に改善する RichSem を提案する。訓練中に正確なバウンディングボックスを必要とせず、これらの豊富で位置に頑健な意味的特徴から学習する意味的ブランチを導入することで、特に希少カテゴリの検出性能が向上し、最小限の訓練オーバーヘッドで最先端の性能を達成する。

ABSTRACT

Long-tailed object detection (LTOD) aims to handle the extreme data imbalance in real-world datasets, where many tail classes have scarce instances. One popular strategy is to explore extra data with image-level labels, yet it produces limited results due to (1) semantic ambiguity -- an image-level label only captures a salient part of the image, ignoring the remaining rich semantics within the image; and (2) location sensitivity -- the label highly depends on the locations and crops of the original image, which may change after data transformations like random cropping. To remedy this, we propose RichSem, a simple but effective method, which is robust to learn rich semantics from coarse locations without the need of accurate bounding boxes. RichSem leverages rich semantics from images, which are then served as additional soft supervision for training detectors. Specifically, we add a semantic branch to our detector to learn these soft semantics and enhance feature representations for long-tailed object detection. The semantic branch is only used for training and is removed during inference. RichSem achieves consistent improvements on both overall and rare-category of LVIS under different backbones and detectors. Our method achieves state-of-the-art performance without requiring complex training and testing procedures. Moreover, we show the effectiveness of our method on other long-tailed datasets with additional experiments. Code is available at \url{https://github.com/MengLcool/RichSem}.

研究の動機と目的

  • 希少カテゴリに起因するデータ不足に起因する長尾オブジェクト検出問題に対処すること。
  • 追加データセットからの画像レベルラベルを用いる手法の限界を克服すること。これらの手法は意味的曖昧さと位置に敏感であるという問題を抱える。
  • 事前学習済みの視覚言語モデルから得られる豊富で頑健な意味的特徴を活用することで、希少カテゴリの検出性能を向上させること。
  • 推論段階の変更や複雑な疑似ラベル付けを必要とせず、特徴表現を強化する訓練フレームワークを開発すること。
  • LVIS や他の長尾分布を示すデータセットを含め、複数のバックボーンとデータセットにおいて有効性を実証すること。

提案手法

  • CLIP を用いて抽出された豊富な意味的特徴と、粗い画像レベルのバウンディングボックスを入力として用いる意味的ブランチをオブジェクト検出器に導入する。
  • ランダムクロップなどのデータオーグメンテーションに対して頑健性を確保するため、画像全体を粗いバウンディングボックス(つまり、モザイク風の入力)として使用する。
  • CLIP埋め込みからカテゴリレベルの意味的特徴を抽出し、これをソフトラベルとして訓練中の追加の監視信号として用いる。
  • 検出ヘッドの損失と意味的ブランチからの distillation 損失を統合した統一分類損失を用いて検出器を訓練する。
  • 訓練後は意味的ブランチを破棄し、推論時にオーバーヘッドが生じない標準的な検出器としてデプロイ可能である。
  • 画像分類用の大規模でバランスの取れたデータセット(例:ImageNet-21k)を活用し、バウンディングボックスのアノテーションが不要な状態で希少カテゴリの学習データを豊かにする。

実験結果

リサーチクエスチョン

  • RQ1事前学習済みの視覚言語モデルから得られる豊富な意味的特徴が、画像レベルラベルを監視信号として用いる場合に、長尾オブジェクト検出の性能向上に寄与するか?
  • RQ2画像全体のバウンディングボックス(粗い位置情報)を用いることで、画像レベルラベルベースの訓練におけるデータオーグメンテーションに起因する位置に敏感な問題が緩和されるか?
  • RQ3CLIP から得られるソフトな意味的特徴が、希少カテゴリ検出において one-hot 画像レベルラベルよりも効果的な監視信号となり得るか?
  • RQ4提案された意味的ブランチが、希少、共通、頻出カテゴリのすべてにおいて特徴の識別性を向上させるか?
  • RQ5複雑な訓練手順を伴わず、異なるバックボーンやデータセットにおいて一貫した性能向上を達成できるか?

主な発見

  • RichSem は LVIS において最先端の性能を達成し、希少カテゴリで 3.0 AP の向上を達成し、全カテゴリで一貫した改善を示した。
  • 強力な事前学習済みバックボーンを用いても、希少カテゴリで約 3.0 AP の向上を達成し、標準的な事前学習を上回る性能を示した。
  • 特徴可視化の結果、RichSem はすべてのカテゴリ頻度において、クラス内に密にクラスタリングされ、クラス間で明確に分離された特徴を生成しており、バランスの取れた表現学習が実現していることが示された。
  • 意味的ブランチのおかげで、低ショットカテゴリの性能が顕著に向上し、distillation 重みを 1 に設定した場合に 3.0 AP の向上を達成したが、頻出カテゴリの性能は維持された。
  • バックボーンが大規模データで事前学習されている場合でも本手法は有効であるため、標準的な事前学習を置き換えるものではなく、補完的であることが示された。
  • 広範なアブレーション実験から、豊富な意味的特徴と粗い位置情報の両方が不可欠であり、統一損失関数が検出と意味的整合性の両方を同時に最適化可能であることが明らかになった。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。