Skip to main content
QUICK REVIEW

[論文レビュー] An empirical study of the effect of background data size on the stability of SHapley Additive exPlanations (SHAP) for deep learning models

Han Yuan, Mingxuan Liu|arXiv (Cornell University)|Apr 24, 2022
Explainable Artificial Intelligence (XAI)被引用数 15
ひとこと要約

本研究は、深層学習モデルのSHapley Additive explanations(SHAP)の安定性に、バックグラウンドデータサイズが与える影響を実証的に調査する。MIMIC-IIIデータセットと3層のANNを用いて、小さなバックグラウンドデータセットではSHAP値と変数ランクが著しく変動するが、サンプルサイズが増加するにつれて安定化し、極端な(最も/最も重要でない)変数に対して高い信頼性を示すU字型の信頼性パターンが見られる。より大きなバックグラウンドデータセットは説明の安定性を向上させる。信頼できる解釈性を得るためには、サイズを優先すべきである。

ABSTRACT

Nowadays, the interpretation of why a machine learning (ML) model makes certain inferences is as crucial as the accuracy of such inferences. Some ML models like the decision tree possess inherent interpretability that can be directly comprehended by humans. Others like artificial neural networks (ANN), however, rely on external methods to uncover the deduction mechanism. SHapley Additive exPlanations (SHAP) is one of such external methods, which requires a background dataset when interpreting ANNs. Generally, a background dataset consists of instances randomly sampled from the training dataset. However, the sampling size and its effect on SHAP remain to be unexplored. In our empirical study on the MIMIC-III dataset, we show that the two core explanations - SHAP values and variable rankings fluctuate when using different background datasets acquired from random sampling, indicating that users cannot unquestioningly trust the one-shot interpretation from SHAP. Luckily, such fluctuation decreases with the increase of the background dataset size. Also, we notice an U-shape in the stability assessment of SHAP variable rankings, demonstrating that SHAP is more reliable in ranking the most and least important variables compared to moderately important ones. Overall, our results suggest that users should take into account how background data affects SHAP results, with improved SHAP stability as the background sample size increases.

研究の動機と目的

  • バックグラウンドデータセットサイズが深層学習モデルのSHAP説明の安定性に与える影響を調査すること。
  • 異なるバックグラウンドサンプルサイズにおけるSHAP値および変数ランクの変動を定量化すること。
  • 正確(BLEU)および曖昧(Jaccard)な類似度測定法を用いて、SHAPに基づく変数ランクの信頼性を評価すること。
  • 安定したモデル解釈を得るための最適なバックグラウンドデータセットサイズの選定に関する実用的ガイダンスを提供すること。

提案手法

  • MIMIC-IIIデータセットから抽出した、サイズが異なるランダムなバックグラウンドデータセット(100~1000)を用いて、SHAP説明を実証的に評価した。
  • バックグラウンドデータセットを用いて事前期待値(P_bg)を推定し、DeepExplainerを用いてインスタンスレベルのSHAP値を計算した。
  • すべてのインスタンスにわたる絶対SHAP値の合計として、モデルレベルの変数重要度を算出した。
  • BLEUスコア(正確な順序比較)およびJaccardインデックス(曖昧な集合類似度)を用いて、変数ランクの安定性を評価した。
  • 各サンプルサイズごとに100回の独立したシミュレーションを実施し、SHAP値およびランクの変動を統計的に定量分析した。
  • サンプルサイズの増加に伴うバックグラウンド分布の収束を、中心極限定理に基づいて説明した。

実験結果

リサーチクエスチョン

  • RQ1バックグラウンドデータセットサイズは、深層学習モデル解釈におけるSHAP値の安定性にどのように影響するか?
  • RQ2異なるサイズのバックグラウンドデータセットから得られる変数ランクは、どの程度変動するか?
  • RQ3SHAP変数ランクの信頼性にU字型のパターンが存在するか? すなわち、最も/最も重要でない変数のランク付けが、中程度に重要とされる変数よりも安定しているか?
  • RQ4安定的かつ信頼できるSHAP説明を得るための最適なバックグラウンドデータセットサイズは何か?
  • RQ5ユーザーは、予算制約のもとで計算コストを推定し、代表的なバックグラウンドデータセットを選定するにはどうすればよいか?

主な発見

  • 小さなバックグラウンドデータセット(例:100サンプル)を用いる場合、SHAP値および変数ランクに著しい変動が見られ、安定性が低いことが示された。
  • バックグラウンドデータセットが大きくなるにつれてSHAP説明の安定性が向上し、100~1000サンプルの範囲でBLEUスコアおよびJaccardスコアが単調に向上した。
  • BLEUおよびJaccardスコアにU字型のパターンが確認され、SHAPは最も/最も重要でない変数のランク付けにおいて最も信頼性が高く、中程度に重要とされる変数では信頼性が低いことが示された。
  • 1000個のバックグラウンドサンプルでは、BLEUスコアが0.818、Jaccardインデックスが0.924(平均)に達し、変数ランクの高い安定性が確認された。
  • 本研究では、全訓練データセットをバックグラウンドデータセットとして使用することが最適である可能性が示唆されたが、計算コストはサンプルサイズに比例して増加する。
  • 100個のサンプルを用いたパイロット実験により、より大きなデータセットの計算コストを推定でき、複雑度はm/100 × C_100に比例して増加する。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。