Skip to main content
QUICK REVIEW

[論文レビュー] Analyzing Classifiers: Fisher Vectors and Deep Neural Networks

Sebastian Bach, Alexander Binder|arXiv (Cornell University)|Dec 1, 2015
Explainable Artificial Intelligence (XAI)参考文献 22被引用数 8
ひとこと要約

本稿は、Fisher Vector(FV)分類器に対するLayer-wise Relevance Propagation(LRP)を初めて拡張し、予測の解釈可能性を可能にした。FVは文脈的特徴——例えば著作権タグ——に強く依存しているのに対し、DNNはオブジェクト固有の特徴に注目していることが明らかになった。FVは文脈によって一般化するのに対し、DNNは学習されたオブジェクト表現によって一般化するが、文脈が誤解を招く場合でも同様の傾向を示す。

ABSTRACT

Fisher Vector classifiers and Deep Neural Networks (DNNs) are popular and successful algorithms for solving image classification problems. However, both are generally considered `black box' predictors as the non-linear transformations involved have so far prevented transparent and interpretable reasoning. Recently, a principled technique, Layer-wise Relevance Propagation (LRP), has been developed in order to better comprehend the inherent structured reasoning of complex nonlinear classification models such as Bag of Feature models or DNNs. In this paper we (1) extend the LRP framework also for Fisher Vector classifiers and then use it as analysis tool to (2) quantify the importance of context for classification, (3) qualitatively compare DNNs against FV classifiers in terms of important image regions and (4) detect potential flaws and biases in data. All experiments are performed on the PASCAL VOC 2007 data set.

研究の動機と目的

  • 解釈可能性を目的として、Fisher Vector分類器に対するLayer-wise Relevance Propagation(LRP)を拡張すること。
  • FVおよびDNNモデルの両方において、画像分類意思決定における文脈の使用度を定量化すること。
  • 同じデータセット上でFVおよびDNN分類器の空間的注目パターンを比較すること。
  • 分類に不適切に影響を与える可能性のあるデータバイアスやアーティファクト(例:著作権タグ)を特定すること。
  • PASCAL VOC 2007を用いて、ヒートマップベースの関連性分析によりモデル意思決定の信頼性を検証すること。

提案手法

  • FV表現に対する関連性バックプロパゲーションスキームを導出することで、Fisher Vector分類器にLRPを拡張する。
  • LRPフレームワークを用いて、最終的な分類意思決定を説明するピクセル単位の関連性スコアを計算する。
  • 式(11)で定義される「外部内関連性比」を導入し、予測における文脈使用度を定量的に測定する。
  • PASCAL VOC 2007データセットにバウンディングボックスアノテーションを適用し、文脈関連性を検証する。
  • 20クラスにわたるFVおよびDNNのヒートマップを比較し、特徴注目パターンの差異を分析する。
  • 可視化と統計的比率を用いて、テキストや背景などオブジェクト以外の特徴へのモデル依存度を検出する。

実験結果

リサーチクエスチョン

  • RQ1Fisher Vector分類器は、オブジェクト自体よりも文脈的画像領域にどれほど依存しているか?
  • RQ2同じ画像分類タスクにおいて、Fisher Vectorモデルの文脈使用度はDNNと比べてどの程度か?
  • RQ3LRPベースのヒートマップは、分類に不適切に影響を与える可能性のある誤った相関関係やデータアーティファクト(例:著作権タグ)を検出できるか?
  • RQ4外部内関連性比は、画像分類器における文脈依存性を効果的に定量化できるか?
  • RQ5解釈可能性手法(例:LRP)は、モデルの性能が真のオブジェクト特徴ではなくアーティファクトによって駆動されている場合を明らかにできるか?

主な発見

  • Fisher Vectorモデルは、画像の左下隅に位置する著作権タグなどの文脈的アーティファクトに強く依存しており、予測に顕著に影響を与えている。
  • 著作権タグを削除すると、FVのヒートマップは顕著に変化するが、DNNのヒートマップはほとんど影響を受けないため、DNNはこのようなアーティファクトに対して頑健であることが示された。
  • 平均的なFVヒートマップでは、オブジェクト領域以外の領域に一貫して高い関連性が観察され、非オブジェクト文脈への系統的注目が確認された。
  • 外部内関連性比は、FVモデルがDNNと比較して顕著に多くの文脈に依存していることを示しており、特に水や空、屋内シーンが予測に寄与する「boat」(船)、「airplane」(飛行機)、「chair」(いす)などのクラスで顕著だった。
  • 「sheep」(ヤギ)、「car」(自動車)、「bicycle」(自転車)などのクラスでは、FVモデルが低い文脈使用度を示したが、依然として良好な性能を達成しており、オブジェクト固有の特徴が利用可能である場合にそれらを活用していることが示唆された。
  • DNNは一貫してオブジェクト自体に注目しており、背景領域の関連性が低く、特に「aeroplane」(飛行機)、「bird」(鳥)、「dog」(いぬ)などのクラスで高い精度を達成しており、オブジェクトベースの推論が頑健であることが示された。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。