Skip to main content
QUICK REVIEW

[論文レビュー] Improving Object Detection with Inverted Attention

Zeyi Huang, Wei Ke|arXiv (Cornell University)|Mar 28, 2019
Advanced Neural Network Applications参考文献 17被引用数 6
ひとこと要約

本論文では、勾配ベースのフィードバックを用いて特徴マップの空間的およびチャネル次元にわたる注目度を反転させる軽量なトレーニングモジュールであるInverted Attention (IA) を提案する。追加パラメータや推論オーバーヘッドが不要な状態で、遮蔽、ぼやけ、ノイズに対する耐性が向上し、2段階および1段階の検出器においてPASCAL VOC2012で最大5.4%、COCO2017で2.1%のmAP向上を安定して達成する。

ABSTRACT

Improving object detectors against occlusion, blur and noise is a critical step to deploy detectors in real applications. Since it is not possible to exhaust all image defects through data collection, many researchers seek to generate hard samples in training. The generated hard samples are either images or feature maps with coarse patches dropped out in the spatial dimensions. Significant overheads are required in training the extra hard samples and/or estimating drop-out patches using extra network branches. In this paper, we improve object detectors using a highly efficient and fine-grain mechanism called Inverted Attention (IA). Different from the original detector network that only focuses on the dominant part of objects, the detector network with IA iteratively inverts attention on feature maps and puts more attention on complementary object parts, feature channels and even context. Our approach (1) operates along both the spatial and channels dimensions of the feature maps; (2) requires no extra training on hard samples, no extra network parameters for attention estimation, and no testing overheads. Experiments show that our approach consistently improved both two-stage and single-stage detectors on benchmark databases.

研究の動機と目的

  • トレーニングデータで網羅的に捉えることが難しい現実世界の画像欠損要因(遮蔽、ぼやけ、ノイズなど)に対するオブジェクト検出器の耐性を向上させること。
  • ハードサンプル生成や注目度推定といった従来手法の限界(追加のトレーニングデータ、パラメータ、推論オーバーヘッドを要すること)を解消すること。
  • トレーニング中に補完的となるオブジェクト部分、チャネル、文脈的特徴に注目を促すことで、特徴の多様性を高めるメカニズムを開発すること。
  • アーキテクチャの変更や推論コストを追加せずに、2段階および1段階の検出器において一貫した性能向上を実現すること。

提案手法

  • IAはバックプロパゲーション中に、バックボーンネットワークの分類スコアに対して特徴マップの勾配を計算することで動作する。
  • 勾配ベースの注目度マップを空間的およびチャネル次元にわたって反復的に反転させることで、注目度を反転させる。
  • 注目度の反転はトレーニング時のみに適用され、推論効率を保ち、追加のネットワークパラメータを必要としない。
  • Faster R-CNN や SSD といった標準的な検出器に、勾配ベースの注目度反転を含めるようにトレーニングループを修正することで、この手法を統合する。
  • 2段階検出器ではROI特徴マップレベルに、1段階検出器では全特徴マップにモジュールを適用する。
  • このプロセスにより、これまで無視されがちなオブジェクト部分、チャネル、文脈的特徴にネットワークが注目するよう促され、特徴の多様性が向上する。

実験結果

リサーチクエスチョン

  • RQ1軽量でパラメータフリーのトレーニングモジュールは、遮蔽やぼやけといった画像欠損要因に対するオブジェクト検出器の耐性を向上させ得るか?
  • RQ2空間的およびチャネル次元にわたるバックプロパゲーション中に注目度を反転させることで、より包括的な特徴学習が達成されるか?
  • RQ3このようなメカニズムは、推論コストを追加せずに2段階および1段階の検出器の両方で性能向上をもたらすか?
  • RQ4ハードサンプル生成や注目度推定と比較して、性能およびトレーニングオーバーヘッドの面でIAは優れているか?
  • RQ5IAは、異なるデータセットにおける小、中、大のオブジェクトすべてで検出性能を向上させるか?

主な発見

  • ResNet101 を用いた PASCAL VOC2012 において、IAは Faster R-CNN の mAP を 73.8% から 79.2% に向上させ、絶対増加率 5.4% を達成した。
  • COCO2017 において、ResNet101 を用いた Faster R-CNN では mAP が 35.5% から 35.5% に、VGG16 を用いた SSD512 では 28.8% から 29.6% に向上した。
  • VOC2007 における VGG16 を用いた Faster R-CNN では、mAP が 69.1% から 71.6% に向上し、相対増加率 2.5% を達成した。
  • IAは VOC2012 の19のオブジェクトカテゴリおよび COCO2017 の14のカテゴリにおいて一貫して検出性能を向上させ、広範な適用可能性を示した。
  • Faster R-CNN では中型および大型オブジェクト、SSD512 では小型および中型オブジェクトの性能向上が見られ、文脈に配慮した特徴学習が行われていることが示唆された。
  • 可視化結果から、IAでトレーニングされたネットワークは、支配的部位への過剰依存を減らし、より包括的なオブジェクト領域および特徴に注目していることがわかった。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。