Skip to main content
QUICK REVIEW

[論文レビュー] Where to Focus: Deep Attention-based Spatially Recurrent Bilinear Networks for Fine-Grained Visual Recognition

Lin Wu, Yang Wang|arXiv (Cornell University)|Sep 18, 2017
Video Surveillance and Tracking Methods参考文献 28被引用数 6
ひとこと要約

本稿では、エンド・トゥ・エンド学習により、判別的なオブジェクト部品の検出と特徴抽出を統合的に実行する、深層アテンションベースの空間的再帰的双線形ネットワークを提案する。ソフトアテンションと空間的LSTM、および双線形プーリングを統合することで、モデルは重要領域に動的に注目し、細粒度画像分類および人物再識別ベンチマークで最先端の性能を達成した。

ABSTRACT

Fine-grained visual recognition typically depends on modeling subtle difference from object parts. However, these parts often exhibit dramatic visual variations such as occlusions, viewpoints, and spatial transformations, making it hard to detect. In this paper, we present a novel attention-based model to automatically, selectively and accurately focus on critical object regions with higher importance against appearance variations. Given an image, two different Convolutional Neural Networks (CNNs) are constructed, where the outputs of two CNNs are correlated through bilinear pooling to simultaneously focus on discriminative regions and extract relevant features. To capture spatial distributions among the local regions with visual attention, soft attention based spatial Long-Short Term Memory units (LSTMs) are incorporated to realize spatially recurrent yet visually selective over local input patterns. All the above intuitions equip our network with the following novel model: two-stream CNN layers, bilinear pooling layer, spatial recurrent layer with location attention are jointly trained via an end-to-end fashion to serve as the part detector and feature extractor, whereby relevant features are localized and extracted attentively. We show the significance of our network against two well-known visual recognition tasks: fine-grained image classification and person re-identification.

研究の動機と目的

  • オクルージョン、視点の変化、照明の変化などの外観のばらつきによって、オブジェクトのカテゴリ間の微細な差が隠されてしまう細粒度視覚認識の課題に対処する。
  • 標準的な双線形プーリングの限界を克服する。双線形プーリングは特徴間の空間的関係を無視し、空間的文脈をモデル化できない。
  • 特徴抽出中に顕著なオブジェクト部品に選択的に注目できる動的かつ空間的に意識的なアテンションを可能にすることで、特徴表現を向上させる。
  • 人間の視覚的注意メカニズムを模倣するように、エンド・トゥ・エンドで関連領域に注目することができる深層学習フレームワークを構築する。
  • 双線形特徴プーリングと空間的再帰性、アテンションメカニズムを組み合わせることで、細粒度認識タスクの性能を向上させる。

提案手法

  • 同一画像から特徴を抽出するために二本のストリームの畳み込みニューラルネットワーク(CNN)を採用し、より優れた識別性を実現する二重の視点を提供する。
  • 二つのCNNストリームからの特徴マップの外積を計算することで双線形プーリングを適用し、高次元の特徴相互作用を捉える。
  • 局所的領域間の空間的依存関係をモデル化するため、空間的長短記憶(LSTM)ユニットを統合し、特徴マップの再帰的処理を可能にする。
  • 空間的LSTM内にソフトアテンション機構を組み込み、関連性に基づいて特徴領域の重みを動的に調整し、判別的な部分に注目する。
  • 確率的バックプロパゲーションを用いてアテンションマップを可視化し、推論時における「どこに」および「何に」注目しているかを解釈する。
  • 全アーキテクチャをエンド・トゥ・エンドで学習し、部品検出、特徴抽出、アテンション重み付けを同時に最適化する。

実験結果

リサーチクエスチョン

  • RQ1細粒度視覚認識において、深層ニューラルネットワークは、どのようにして最も判別的なオブジェクト部品に動的かつ選択的に注目できるか?
  • RQ2空間的再帰的LSTMは、双線形特徴における空間的関係のモデル化を改善し、より良い表現学習を実現できるか?
  • RQ3ソフトアテンションを双線形プーリングと統合することで、細粒度分類および人物再識別タスクの性能が向上するか?
  • RQ4モデルのアテンションメカニズムは、人間の視覚的直感とどの程度一致しているか?
  • RQ5提案手法は、固定された空間的分割や手作業で設計された部品検出器に依存する既存の最先端モデルを上回ることができるか?

主な発見

  • スタンフォード・カーズデータセットでは、トップ-1正解率が93.4%を達成し、Krauseら(92.6%)やGosselinら(82.7%)の先行手法を上回った。
  • CUB-200-2011データセットでは、細粒度画像分類で最先端の性能を達成し、優れた特徴局所化と識別能を示した。
  • 人物再識別においては、VIPeR、CUHK03、Market-1501ベンチマークで複数の最先端手法を上回るランク-1正解率を達成した。
  • アテンションマップの可視化により、モデルが頭部、羽、体の部位など意味的に意味のある領域に注目していることが確認され、人間の直感と一致した。
  • 手動による部品分割に依存するマルチリージョン双線形モデルよりも顕著に優れた性能を示し、エンド・トゥ・エンドで学習されたアテンションの利点を実証した。
  • 空間的再帰性とアテンションの統合により、局所的歪みや空間的変換に対して頑健性が向上し、挑戦的な視覚認識タスクにおける一般化性能が向上した。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。