Skip to main content
QUICK REVIEW

[論文レビュー] Dual-attention Focused Module for Weakly Supervised Object Localization

Yukun Zhou, Zailiang Chen|arXiv (Cornell University)|Sep 11, 2019
Advanced Neural Network Applications参考文献 30被引用数 4
ひとこと要約

本稿では、弱教師付きオブジェクト検出のための新しいアテンションメカニズムとして、空間的およびチャネル別アテンションを統合的にモデル化して特徴表現を向上させる、二重アテンション集中モジュール(DFM)を提案する。位置ブランチとチャネルブランチを、集中行列正則化と特徴統合によって統合することで、DFMは局所化精度を向上させ、ILSVRC 2016およびCUB-200-2011ベンチマークで最先端の性能を達成した。

ABSTRACT

The research on recognizing the most discriminative regions provides referential information for weakly supervised object localization with only image-level annotations. However, the most discriminative regions usually conceal the other parts of the object, thereby impeding entire object recognition and localization. To tackle this problem, the Dual-attention Focused Module (DFM) is proposed to enhance object localization performance. Specifically, we present a dual attention module for information fusion, consisting of a position branch and a channel one. In each branch, the input feature map is deduced into an enhancement map and a mask map, thereby highlighting the most discriminative parts or hiding them. For the position mask map, we introduce a focused matrix to enhance it, which utilizes the principle that the pixels of an object are continuous. Between these two branches, the enhancement map is integrated with the mask map, aiming at partially compensating the lost information and diversifies the features. With the dual-attention module and focused matrix, the entire object region could be precisely recognized with implicit information. We demonstrate outperforming results of DFM in experiments. In particular, DFM achieves state-of-the-art performance in localization accuracy in ILSVRC 2016 and CUB-200-2011.

研究の動機と目的

  • 画像レベルのラベルしか入手できない弱教師付きオブジェクト検出における、オブジェクトの局所化が不完全であるという課題に対処すること。
  • 全オブジェクトからの文脈的情報を保持しつつ、特徴を判別性の高い領域に集中させることで、特徴表現を向上させること。
  • 局所化の過程で、顕著なパッチに隠されたオブジェクトの部分が覆い隠される問題を軽減すること。
  • 空間的およびチャネル別特徴を効果的に統合する新しいアテンションメカニズムを用いて、局所化性能を向上させること。

提案手法

  • 二重アテンション集中モジュール(DFM)は、空間的アテンションとチャネル別アテンションをそれぞれ処理する2つの並列ブランチ(位置ブランチとチャネルブランチ)から構成される。
  • 各ブランチは、入力特徴マップから強化マップとマスクマップを生成し、特定の特徴を強調または抑制する。
  • 位置ブランチに集中行列が導入され、オブジェクトピクセルの空間的連続性を強制することで、局所化の一貫性が向上する。
  • 各ブランチの強化マップと対応するマスクマップが統合され、失われた特徴が回復され、表現の多様性が向上する。
  • 統合された特徴は、最終的な局所化マップの精練に使用され、計算オーバーヘッドを最小限に抑えながら検出精度が向上する。
  • モジュールは標準的な弱教師付きオブジェクト検出フレームワークに統合され、交差エントロピー損失を用いてエンドツーエンドで訓練される。

実験結果

リサーチクエスチョン

  • RQ1判別性の高い部分に注目することで局所化を向上させるアテンションメカニズムを設計するには、どのようにすれば、オブジェクト全体の文脈的情報を失わずに行えるか?
  • RQ2空間的連続性制約は、弱教師付き設定におけるオブジェクト局所化のロバスト性を向上させ得るか?
  • RQ3空間的およびチャネル別アテンションの共同モデリングは、弱教師付きオブジェクト検出における特徴表現をどの程度向上させ得るか?
  • RQ4集中行列正則化を施した提案された二重アテンションモジュールは、標準ベンチマークにおいて既存のアテンションメカニズムを上回る性能を示すか?

主な発見

  • DFMは、ILSVRC 2016データセットにおいて、最先端の平均インターセクションオーバーユニオン(mIoU)性能を達成し、先行手法を上回った。
  • CUB-200-2011ベンチマークでは、比較されたすべての弱教師付き手法の中で最高の局所化精度を達成した。
  • アブレーションスタディの結果、二重アテンション機構と集中行列の両方が、性能向上に顕著な寄与をしていることが確認された。
  • 本手法は多様なオブジェクトカテゴリおよび複雑な背景に対してもロバストであることが示され、優れた汎化能力を有していることがわかった。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。