[論文レビュー] A Refutation of Shapley Values for Explainability
本稿は、特徴量の寄与度を説明可能AIで評価する際のシャープレイ値の使用を、ある小さな閾値を超える任意の特徴量数に対して、関係のない特徴量が関係のある特徴量よりも高いシャープレイ値を割り当てられるようなブール関数が存在することを証明することで反証する。これは、シャープレイ値がルールベースの説明において特徴量の重要性を体系的に誤って表現する可能性があることを示している。
Recent work demonstrated the existence of Boolean functions for which Shapley values provide misleading information about the relative importance of features in rule-based explanations. Such misleading information was broadly categorized into a number of possible issues. Each of those issues relates with features being relevant or irrelevant for a prediction, and all are significant regarding the inadequacy of Shapley values for rule-based explainability. This earlier work devised a brute-force approach to identify Boolean functions, defined on small numbers of features, and also associated instances, which displayed such inadequacy-revealing issues, and so served as evidence to the inadequacy of Shapley values for rule-based explainability. However, an outstanding question is how frequently such inadequacy-revealing issues can occur for Boolean functions with arbitrary large numbers of features. It is plain that a brute-force approach would be unlikely to provide insights on how to tackle this question. This paper answers the above question by proving that, for any number of features, there exist Boolean functions that exhibit one or more inadequacy-revealing issues, thereby contributing decisive arguments against the use of Shapley values as the theoretical underpinning of feature-attribution methods in explainability.
研究の動機と目的
- 任意の数の特徴量をもつブール関数において、シャープレイ値による誤った特徴量重要性の割り当てが一般的であるか、まれであるかを調査すること。
- 小さな関数に限定してブルートフォースによる全列挙に依存していた先行研究の限界を克服し、より大きな特徴量集合に一般化できるようにすること。
- ある小さな閾値を超える任意の特徴量数において、関係のある特徴量と関係のない特徴量の間で、シャープレイ値が相対的な重要性の順序を誤って割り当てる可能性があることを形式的に証明すること。
- 実験的ではなく、体系的な方法で誤った例を構築できる構成的証明を提供すること。
- ルールベースモデルにおける特徴量選択の原則と根本的に不適合であることを示すことにより、シャープレイ値の説明可能性における理論的基盤を揺るがすこと。
提案手法
- 変数が $ n $ 個あるブール関数の族を構築し、その構造によって、1つの関係のない特徴量(例:$ x_{n-1} $)が関係のある特徴量(例:$ x_n $)よりも高いシャープレイ値を割り当てるようにする。
- 段階的な関数定義を用いる:$ \kappa(x_{1..m}, x_{n-1}, x_n) $ で、出力が $ \kappa_1 $、$ \kappa_2 $、$ \kappa_3 $ に依存し、$ \kappa_3 $ は特定のターゲット点からのハミング距離が2以内の範囲で1に設定される。
- シャープレイ値の公式を適用する:$ \mathsf{Sv}(i) = \sum_{\mathcal{S} \subseteq \mathcal{F} \setminus \{i\}} \frac{|\mathcal{S}|!(m - |\mathcal{S}|)!}{(m+1)!} \left( \phi(\mathcal{S} \cup \{i\}) - \phi(\mathcal{S}) \right) $、特にサイズ $ m-4 $ から $ m+1 $ の部分集合に注目する。
- 部分集合ごとの限界寄与度を分析し、関係のない特徴量 $ x_{n-1} $ のシャープレイ値が、予測に不可欠な関係のある特徴量 $ x_n $ よりも大きいことを示す。
- 臨界部分集合における寄与の和を計算して $ \mathsf{Sv}(n-1) > \mathsf{Sv}(n) > 0 $ を証明する。
- このような反例が $ m \geq 5 $ に対して常に存在することを示し、$ \kappa_1 $ に対しては $ 2^{2^{n-2} - (n-2) - 1} - 1 $ 通りの構成が可能であることを示し、その数が非常に多いことを保証する。
実験結果
リサーチクエスチョン
- RQ1ルールベースモデルにおいて、シャープレイ値が特徴量の重要性を体系的に誤って順位付けし、関係のない特徴量に高い値を割り当てる可能性があるか?
- RQ2任意の数の特徴量をもつブール関数において、このような誤ったケースはまれか、それとも一般的か?
- RQ3任意に大きな数の特徴量をもつ明示的なブール関数を構築でき、シャープレイ値が真の特徴量の関連性を反映しない状況を示せるか?
- RQ4シャープレイ値の説明可能性における不適切さは、構造的欠陥であるのか、それとも小さな極端な関数に限局しているのか?
- RQ5このような誤った振る舞いを示す関数の集合のサイズはどの程度で、特徴量数の増加に伴いどのようにスケーリングされるか?
主な発見
- 任意の特徴量数 $ n > 3 $ に対して、関係のない特徴量が関係のある特徴量よりも高いシャープレイ値を割り当てるようなブール関数が存在する。
- 本稿は、このような関数を明示的に構築し、問題が小さなケースやまれなケースに限らないことを証明しており、$ n $ が大きくなると一般に発生することを示している。
- 関係のない特徴量 $ x_{n-1} $ のシャープレイ値が関係のある特徴量 $ x_n $ よりも大きいことが、部分集合の寄与度分析により示され、$ \mathsf{Sv}(n-1) > \mathsf{Sv}(n) > 0 $ が成立する。
- サイズ $ m-4 $ から $ m+1 $ の部分集合における $ x_n $ の限界寄与度の和が正であることが示され、$ \mathsf{Sv}(n) > 0 $ であることが証明され、一方 $ \mathsf{Sv}(n-1) $ は依然として大きい。
- このような誤順位付けが生じる異なる関数は少なくとも $ 2^{2^{n-2} - (n-2) - 1} - 1 $ 個存在し、これは顕著な数の反例を示している。
- 結果はすべての $ m \geq 5 $ に対して成り立ち、構成法により特徴量数が増えても問題が解消されないことが保証されており、説明可能AIにおけるシャープレイ値の一般応用性を揺るがしている。
より良い研究を、今すぐ始めましょう
論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。
クレジットカード登録不要
このレビューはAIが作成し、人間の編集者が確認しました。