[論文レビュー] On the Tractability of SHAP Explanations
本稿は、完全に要因分解された分布、ナイーブベイズ分布、および経験的分布の3つの主要な設定において、SHAP解釈の計算複雑性を確立している。完全に要因分解された分布下でロジスティック回帰およびニューラルネットワークに対してSHAP値を計算することは#P困難であることを証明し、ナイーブベイズモデルでは計算が非効率的であり、経験的データに対しても#P困難であることを示している。これは、一般的に実用で広く使われているにもかかわらず、正確な計算が一般的には非現実的であることを示している。
SHAP explanations are a popular feature-attribution mechanism for explainable AI. They use game-theoretic notions to measure the influence of individual features on the prediction of a machine learning model. Despite a lot of recent interest from both academia and industry, it is not known whether SHAP explanations of common machine learning models can be computed efficiently. In this paper, we establish the complexity of computing the SHAP explanation in three important settings. First, we consider fully-factorized data distributions, and show that the complexity of computing the SHAP explanation is the same as the complexity of computing the expected value of the model. This fully-factorized setting is often used to simplify the SHAP computation, yet our results show that the computation can be intractable for commonly used models such as logistic regression. Going beyond fully-factorized distributions, we show that computing SHAP explanations is already intractable for a very simple setting: computing SHAP explanations of trivial classifiers over naive Bayes distributions. Finally, we show that even computing SHAP over the empirical distribution is #P-hard.
研究の動機と目的
- 異なるデータ分布およびモデルクラスにおけるSHAP解釈の計算複雑性を特定すること。
- 一般的な機械学習モデルに対してSHAP値が効率的に計算可能かどうかという未解決の問いを解消すること。
- 完全に要因分解されたような単純化された設定ですら、標準的なモデルに対して計算が非効率的になることを示すこと。
- 特に広く採用されていることから、実用におけるSHAP解釈の理論的限界を明確にすること。
提案手法
- 完全に要因分解された分布、ナイーブベイズ分布、および経験的分布の3つのデータ分布タイプにおけるSHAP計算の複雑性を分析する。
- 期待モデル出力を計算する問題をSHAP値計算に還元し、完全に要因分解された設定では両者の複雑性が同等であることを示す。
- #P完全問題(例:PP2CNF論理式の期待値の計算)からの還元を用いて、#P困難性を証明する。
- 修正された関数と特徴量拡張を用いた、多項式時間オракルベースの変換を構築してSHAP値を計算する。
- 行列の行列式解析と再帰関係を用いて、還元における係数行列の非特異性を証明する。
- 元の論理式を変換して、多項式補間と係数抽出を用いて期待値を導出する。
実験結果
リサーチクエスチョン
- RQ1完全に要因分解されたデータ分布下で、一般的に使われるモデル(例:ロジスティック回帰)に対してSHAP解釈を計算するのは tractable か?
- RQ2データ分布における特徴量の独立性の仮定が、SHAP計算の効率性を向上させるか?
- RQ3ナイーブベイズ分布上でのSHAP解釈の複雑性はいかほどか?(独立性仮定を緩和した設定)
- RQ4学習データから導かれる経験的分布上でのSHAP計算は tractable か?
- RQ5Lundbergら(2020)が提案した決定木に対する多項式時間アルゴリズムは、正確なSHAP計算に関して正しいか?
主な発見
- 完全に要因分解されたデータ分布下で、ロジスティック回帰およびシグモイド活性化関数を用いたニューラルネットワークのSHAP解釈の計算は#P困難である。
- ナイーブベイズ分布上でも、単純な分類器に対してもSHAP計算は非効率的であり、これは線形回帰およびロジスティック回帰モデルに対しても同様の困難性を示唆している。
- 経験的分布上でのSHAP計算は#P困難であるため、実用上での正確な計算は効率的ではない。
- 完全に要因分解された分布下での期待モデル出力の計算複雑性と、SHAP解釈の複雑性は等価である。
- Lundbergら(2020)が提案した決定木に対する多項式時間アルゴリズムは、正確なSHAP計算に関して正しくないことが、#P困難性の結果から示された。
- PP2CNFモデルカウンティングからSHAP計算への還元により、一般に正確なSHAP値の計算は計算的に非効率的であることが証明された。
より良い研究を、今すぐ始めましょう
論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。
クレジットカード登録不要
このレビューはAIが作成し、人間の編集者が確認しました。