Skip to main content
QUICK REVIEW

[論文レビュー] Weakly Supervised Bilinear Attention Network for Fine-Grained Visual Classification

Tao Hu, Jizheng Xu|arXiv (Cornell University)|Aug 6, 2018
Advanced Neural Network Applications参考文献 27被引用数 9
ひとこと要約

本稿では、可学習な注目マップを用いて複数のオブジェクト部位を同時に局所化し、双一次注目プーリング(BAP)を用いて特徴を抽出することで、弱教師付きのエンドツーエンドフレームワークである弱教師付き双一次注目ネットワーク(WS-BAN)を提案する。弱教師付き学習において注目正則化とドロップアウトを導入することで、CUB-200-2011、Stanford Cars、FGVC-Aircraftで最先端の精度を達成し、それぞれ92.3%、93.6%、88.8%のトップ-1精度を達成した。

ABSTRACT

For fine-grained visual classification, objects usually share similar geometric structure but present variant local appearance and different pose. Therefore, localizing and extracting discriminative local features play a crucial role in accurate category prediction. Existing works either pay attention to limited object parts or train isolated networks for locating and classification. In this paper, we propose Weakly Supervised Bilinear Attention Network (WS-BAN) to solve these issues. It jointly generates a set of attention maps (region-of-interest maps) to indicate the locations of object's parts and extracts sequential part features by Bilinear Attention Pooling (BAP). Besides, we propose attention regularization and attention dropout to weakly supervise the generating process of attention maps. WS-BAN can be trained end-to-end and achieves the state-of-the-art performance on multiple fine-grained classification datasets, including CUB-200-2011, Stanford Car and FGVC-Aircraft, which demonstrated its effectiveness.

研究の動機と目的

  • クラス内変動と微細なクラス間差異が生じる細分化視覚分類の課題に対処すること。
  • 既存の弱教師付き手法が一部のオブジェクト部位にのみ注目し、判別性が低い領域を無視するという限界を克服すること。
  • エンドツーエンドで注目マップと部位特徴を同時に学習することで、部位局所化と特徴表現を向上させること。
  • 部位レベルのアノテーションに依存せず、画像レベルラベルのみを用いた弱教師付き学習により、アノテーションコストを低減すること。
  • 正則化とドロップアウトによるアテンションの多重部位への注目を促進することで、オクルージョンや視点変化に対してより頑健なモデルを構築すること。

提案手法

  • 特徴マップと可学習な注目マップの要素ごとの積を計算し、その後に畳み込みとグローバルプーリングを適用することで、部位特徴行列を生成する双一次注目プーリング(BAP)を提案する。
  • 同じカテゴリの部位特徴を共通の中心に引き寄せる注目正則化を導入し、一貫性のある部位表現を促進する。
  • 訓練中に注目マップをランダムに無効化する注目ドロップアウトを適用し、ネットワークが判別性が低い部位にも注目するよう強制することで一般化性能を向上させる。
  • 最終的な注目マップを、チャネルにわたって平均化し、しきい値処理を施してバウンディングボックスを生成することで、オブジェクト部位の局所化マスクとして利用する。
  • 部位アノテーションが不要な画像レベルのカテゴリラベルのみを用いて、ネットワーク全体をエンドツーエンドで学習させ、弱教師付き学習を実現する。
  • 初期特徴マップを抽出するために深層畳み込みニューラルネットワーク(例:ResNet)をバックボーンとして用い、その後にBAPモジュールと注目ヘッドを処理する。

実験結果

リサーチクエスチョン

  • RQ1部位レベルのアノテーションが不要な弱教師付き手法が、複数の細分化されたオブジェクト部位を効果的に局所化できるか。
  • RQ2注目マップと部位特徴を同時に学習することで、一部の部位にのみ注目する手法と比較して、分類精度がどのように向上するか。
  • RQ3注目正則化とドロップアウトが、部位局所化の多様性と頑健性をどの程度向上させるか。
  • RQ4モデルが生成する注目マップを、オブジェクト局所化およびバウンディングボックス予測に効果的に利用できるか。
  • RQ5注目マップの数を増やすことで、分類精度と局所化品質にどのような影響が生じるか。

主な発見

  • FGVC-Aircraftデータセットにおいて、WS-BANは92.3%の最先端のトップ-1精度を達成し、MPN-COV(93.3%)やMAMC(93.0%)を上回った。
  • CUB-200-2011データセットでは、WS-BANが92.3%の精度を達成し、RA-CNN(88.4%)やMA-CNN(89.9%)を上回り、鳥種分類において優れた性能を示した。
  • Stanford Carsデータセットでは、WS-BANが93.6%の精度を達成し、以前のSOTA手法であるMPN-COV(93.3%)やMAMC(93.0%)を上回った。
  • CUB-200-2011におけるオブジェクト局所化誤差は、WS-BANで28.2%にまで低下し、GoogLeNet-GAP(59.0%)やVGGnet-ACoL(54.1%)よりも顕著に低く、局所化能力の向上を示した。
  • 注目マップの数を4から128に増やすことで、分類精度は85.9%から88.8%に、mIOUは53.4%から58.2%に向上し、より多くの部位を学習することで性能が向上することを示した。
  • 可視化により、注目正則化とドロップアウトを適用した場合、注目マップが頭部、翼、体幹などのオブジェクト部位に均等に分布しているのに対し、ベースラインのBAPのみでは疎で一貫性のない注目マップが得られることが確認された。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。