Skip to main content
QUICK REVIEW

[論文レビュー] Shapley Values of Reconstruction Errors of PCA for Explaining Anomaly Detection

Naoya Takeishi|arXiv (Cornell University)|Sep 8, 2019
Anomaly Detection Techniques and Applications参考文献 29被引用数 5
ひとこと要約

本稿では、PCAに基づく異常検出における再構成誤差のシャープレイ値を計算する手法を提案する。PCAの確率的モデルを用いることで、特徴量の相関を正確に反映する。このアプローチにより、原始的な再構成誤差よりも、異常な特徴量の説明がより信頼性が高くなる。実験結果では、ベンチマークデータセットにおける異常の局在化が向上している。

ABSTRACT

We present a method to compute the Shapley values of reconstruction errors of principal component analysis (PCA), which is particularly useful in explaining the results of anomaly detection based on PCA. Because features are usually correlated when PCA-based anomaly detection is applied, care must be taken in computing a value function for the Shapley values. We utilize the probabilistic view of PCA, particularly its conditional distribution, to exactly compute a value function for the Shapely values. We also present numerical examples, which imply that the Shapley values are advantageous for explaining detected anomalies than raw reconstruction errors of each feature.

研究の動機と目的

  • 特徴量に相関がある状況において、原始的な再構成誤差が異常を説明する上で限界を示す問題に対処すること。
  • シャープレイ値を用いて再構成誤差への寄与を公平に割り当てる手法を開発すること。
  • PCAの確率的定式化を活用し、シャープレイ値の正確な値関数を計算すること。
  • 数値例を通じて、シャープレイ値が再構成誤差単体よりも、異常説明においてより正確であることを示すこと。

提案手法

  • PCAの確率的視点を用いて、潜在変数を条件とする特徴量の条件付き分布を導出する。
  • 特徴量がコалиションに追加された際の期待再構成誤差低減量に基づき、シャープレイ値の値関数を定義する。
  • 導出された値関数を用いて、特徴量の依存関係を考慮した正確なシャープレイ値を各特徴量について計算する。
  • 再構成誤差を異常スコアとするPCAベースの異常検出にこの手法を適用する。
  • 数値実験において、比較のためのベースラインとしてカーネルSHAPを用いる。
  • 実世界のデータセット(既知の異常を有する)に対して手法を検証し、シャープレイ値と原始的再構成誤差を比較する。

実験結果

リサーチクエスチョン

  • RQ1シャープレイ値は、PCAベースの異常検出における再構成誤差に最も寄与している特徴量を、原始的再構成誤差よりも正確に説明できるか?
  • RQ2PCAの確率的モデルによる特徴量相関の取り扱いは、異常説明の解釈可能性をどのように向上させるか?
  • RQ3シャープレイ値は、実世界のデータセットにおける人間が特定した異常特徴量とどの程度相関しているか?
  • RQ4特に特徴量の依存関係がある状況において、シャープレイ値はカーネルSHAPと比較して再構成誤差をどの程度よく説明できるか?
  • RQ5本手法は、多様なデータセットにおいて一貫して再構成誤差を上回る異常局在化性能を示せるか?

主な発見

  • シャープレイ値は原始的再構成誤差を著しく上回り、異常局在化性能が向上している。Maxケースでは、Hits@1とHits@3がそれぞれ0.316から0.484、0.605から0.801に向上した。
  • Minケースでは、Hits@1とHits@3が0.271と0.471から0.484と0.710に向上し、より強い異常局在化性能が示された。
  • 全データセットにおいて再構成誤差とシャープレイ値の相関は高く(中央値r_all = 0.866)、しかし正常(r_good)および異常(r_bad)サブセットでは顕著に異なるため、文脈依存の性能を示している。
  • ママグラフィー・データセットでは、正常サブセットの相関が低く(r_good = 0.268)であったため、特徴量の相関がある状況においてシャープレイ値が異常をより的確に特定していると示唆される。
  • 10のデータセットのうち7つで再構成誤差とシャープレイ値の相関が高く(r_all > 0.9)、特にアイオノスフィア(r_all = 0.984)やワイン(r_all = 0.817)で顕著であった。
  • 結果から、特徴量の依存関係が存在する状況では、シャープレイ値が原始的再構成誤差よりも信頼性の高い異常説明を提供することが示された。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。