Skip to main content
QUICK REVIEW

[論文レビュー] Interpretable and Accurate Fine-grained Recognition via Region Grouping

Zixuan Huang, Yin Li|arXiv (Cornell University)|May 21, 2020
Advanced Neural Network Applications参考文献 66被引用数 7
ひとこと要約

本論文は、部分出現に関するU字型の事前分布を用いて、物体の部分とその寄与を発見する解釈可能な細粒度視覚認識のための深層学習モデルを提案する。特徴を一貫性のある領域にグループ化し、正則化を施した注目メカニズムを適用することで、画像ラベルのみを用いてCUB-200、CelebA、iNaturalistで最先端の精度と優れた局在化性能を達成した。

ABSTRACT

We present an interpretable deep model for fine-grained visual recognition. At the core of our method lies the integration of region-based part discovery and attribution within a deep neural network. Our model is trained using image-level object labels, and provides an interpretation of its results via the segmentation of object parts and the identification of their contributions towards classification. To facilitate the learning of object parts without direct supervision, we explore a simple prior of the occurrence of object parts. We demonstrate that this prior, when combined with our region-based part discovery and attribution, leads to an interpretable model that remains highly accurate. Our model is evaluated on major fine-grained recognition datasets, including CUB-200, CelebA and iNaturalist. Our results compare favorably to state-of-the-art methods on classification tasks, and our method outperforms previous approaches on the localization of object parts.

研究の動機と目的

  • 予測の解釈を部分セグメンテーションと寄与度の割り当てによって行う、細粒度視覚認識のための解釈可能な深層モデルの開発。
  • 部分アノテーションを一切用いずに、深層ネットワーク内での領域ベースのグループ化機構を活用して意味のある物体部分を発見すること。
  • 部分出現に簡単なU字型事前分布を組み込むことで、モデルの解釈可能性と精度を向上させること。
  • 分類精度と局在化忠実度の両面に注目して、標準的な細粒度認識ベンチマークでのモデルの評価。
  • 弱い部分出現事前分布を、領域ベースの発見と注目メカニズムと組み合わせることで、弱教師付き部分監視なしに高い性能を達成できることの実証。

提案手法

  • 学習された部分表現の辞書と比較することで、ピクセル特徴を視覚的に一貫性のある領域にグループ化する深層ニューラルネットワークを用いる。
  • 最終分類のための判別的で部分セグメントのサブセットを選択する注目メカニズムを適用する。
  • 部分出現にU字型事前分布を課し、トレーニングを正則化するために地球移動距離(Earth Mover’s Distance)を用いる。
  • 部分アノテーションを一切使用せず、画像ラベルとU字型事前分布の正則化のみを用いて、エンドツーエンドでモデルを訓練する。
  • 完全畳み込み型の推論を実行し、入力に全画像を供給することで、局在化と一般化性能を向上させる。
  • 解釈可能な出力を生成する:部分セグメンテーションマップ、各部分ごとの注目重み、最終的な分類ラベル。

実験結果

リサーチクエスチョン

  • RQ1画像ラベルのみを用いて、意味のある物体部分を発見し、分類への寄与度を割り当てられるか?
  • RQ2部分出現に簡単なU字型事前分布を用いることで、弱教師付き部分発見のための有効性はどの程度高いか?
  • RQ3領域ベースの部分発見と注目メカニズム、および事前分布の正則化を組み合わせることで、最先端の精度を達成しつつ高い解釈可能性を維持できるか?
  • RQ4細粒度データセットにおいて、本モデルの局在化性能は、従来のサリエンシーおよび注目ベースの手法と比べてどうか?
  • RQ5U字型事前分布と注目メカニズムが、部分局在化精度とモデルの頑健性に与える影響は何か?

主な発見

  • iNaturalist 2017 データセットでは、完全畳み込み型テストを用いてResNet101の精度を5.7%向上(61.1% → 66.8%)した。
  • iNaturalistのPointing Gameベンチマークでは、最低の局在化誤差(7.6%)を記録し、CAM/Grad-CAM(11.8%)とGuided Grad-CAM(8.2%)を上回った。
  • CelebAでは、左目に対して7.4%、右目に対して7.5%、鼻に対して9.1%の局在化誤差を達成し、全モデルの精度は91.5%であった。
  • アブレーションスタディの結果、正則化項を除去すると局在化誤差が8.4%から12.3%に上昇し、正則化が部分局在化の向上において極めて重要な役割を果たしていることが示された。
  • 注目メカニズムなしのモデルはやや優れた局在化(7.6%誤差)を示したが、特定部分への重要度の割り当て能力を失ったため、解釈可能性と性能のトレードオフが顕在化した。
  • iNaturalistにおける失敗事例は、5,000以上のカテゴリにわたる単一のU字型事前分布の制限に起因するとされ、今後の研究ではより柔軟な事前分布の必要性が示唆された。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。