Skip to main content
QUICK REVIEW

[論文レビュー] Explaining the data or explaining a model? Shapley values that uncover non-linear dependencies

Daniel Fryer, Inga Strümke|arXiv (Cornell University)|Jul 12, 2020
Explainable Artificial Intelligence (XAI)参考文献 27被引用数 8
ひとこと要約

この論文は、エネルギー距離相関、アフィン不変距離相関、ヒルバート=シュミット独立性基準といった統計的依存度測定法を特徴関数として用いることで、非線形特徴依存関係をモデルに依存しない方法で説明する最初の手法である Sunnies を提案する。モデル依存的手法とは異なり、Sunnies は訓練済みモデルに依存せずに、内在するデータ構造を明らかにでき、非線形的依存関係を個々の特徴に帰属づけることで、効果的な探索的データ分析とモデル診断を可能にする。

ABSTRACT

Shapley values have become increasingly popular in the machine learning literature thanks to their attractive axiomatisation, flexibility, and uniqueness in satisfying certain notions of `fairness'. The flexibility arises from the myriad potential forms of the Shapley value extit{game formulation}. Amongst the consequences of this flexibility is that there are now many types of Shapley values being discussed, with such variety being a source of potential misunderstanding. To the best of our knowledge, all existing game formulations in the machine learning and statistics literature fall into a category which we name the model-dependent category of game formulations. In this work, we consider an alternative and novel formulation which leads to the first instance of what we call model-independent Shapley values. These Shapley values use a (non-parametric) measure of non-linear dependence as the characteristic function. The strength of these Shapley values is in their ability to uncover and attribute non-linear dependencies amongst features. We introduce and demonstrate the use of the energy distance correlations, affine-invariant distance correlation, and Hilbert-Shmidt independence criterion as Shapley value characteristic functions. In particular, we demonstrate their potential value for exploratory data analysis and model diagnostics. We conclude with an interesting expository application to a classical medical survey data set.

研究の動機と目的

  • モデルの動作ではなく、データの内在的依存関係を説明できるモデルに依存しないシャープレイ値手法の不足を補うこと。
  • 適合済みモデルやモデルクラスに依存しない特徴重要度のフレームワークを構築すること。
  • 統計的依存に基づく原理的かつ公平な帰属割り当てメカニズムを用いて、データ内の非線形的および相互作用的効果を検出すること。
  • このような値が探索的データ分析およびモデル診断においてどのように有用であるかを示すこと、特にデータとモデル予測の乖離を特定する際の有効性を強調すること。
  • 実世界のデータにおける性別関連のバイアスや構造的不一致を明らかにするための新しい診断的レンズを提供すること、例えば医療データにおける性別バイアスの例を含む。

提案手法

  • 特徴関数としてモデルの性能や予測誤差ではなく、非線形統計的依存度(例:エネルギー距離相関、HSIC、AIDC)を用いる新しいゲーム定式化を提案する。
  • 各特徴の、特徴集合と目的変数との間の全体的依存度への限界寄与度に基づいてシャープレイ値を定義し、依存度測定法を報酬関数として使用する。
  • 正確な計算が大規模な特徴集合では不可能であるため、Sonn et al. (2016) が提唱した一貫性のあるモンテカルロアルゴリズムをシャープレイ値の近似に適用する。
  • データ構造とモデル行動を比較するための3つの診断指標(ラベルへの帰属依存度(ADL)、モデル予測への帰属依存度(ADP)、残差への帰属依存度(ADR))を導入する。
  • 特徴が互いに独立であることが事前に分かっている場合には、ブロック分解を用いることで、計算コストを O(2^n) から O(2^k) に削減する(k << n)。
  • 距離相関(DC)による依存度検出のための集団レベルの漸近的保証を採用するが、線形関係に偏りが生じることを認識している。

実験結果

リサーチクエスチョン

  • RQ1訓練済みモデルに依存せずに、非線形的依存関係を説明できるシャープレイ値を定式化できるか?
  • RQ2統計的依存度測定法を特徴関数として用いることで、モデルに依存しないシャープレイ値をどのように構築できるか?
  • RQ3このような値は、時間経過やデータサブセット間で依存構造の変化をどの程度検出できるか?
  • RQ4モデルに依存しないシャープレイ値は、モデルとデータの不一致を診断する際、モデル依存型の対比と比べてどの程度優れているか?
  • RQ5このアプローチは、医療データにおける性別バイアスのような、隠れたバイアスや構造的不一致を明らかにできるか?

主な発見

  • Sunnies は、動的データ生成過程において、モデル性能が劣化する前までに、非線形的依存構造の変化を特定し、その変化を特定の特徴に帰属づけることに成功した。
  • モデル診断において、性別がバランスしたデータで学習したモデルが、女性の真の依存構造を捉えていないことが明らかになったが、これはモデル表現における潜在的バイアスを示唆している。
  • 5つの特徴から得られる240個の限界寄与度を、各診断指標(ADL、ADP、ADR)ごとに5つの解釈可能なシャープレイ値に要約でき、明確な可視化と洞察抽出を可能にした。
  • エネルギー距離相関、AIDC、HSIC を特徴関数として用いることで、線形手法が見逃す可能性のある非線形的および非正規依存関係の検出が可能になった。
  • シャープレイ値の指数的計算複雑性にもかかわらず、特徴の独立性を活用したブロック分解により、必要な限界寄与度の数を削減し、計算の現実可能性が向上した。
  • 本手法は、データ駆動の依存関係(ADL)とモデル駆動の依存関係(ADP)を区別する診断ツールを提供し、モデルの失敗やバイアスを示す乖離を強調した。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。