Skip to main content
QUICK REVIEW

[論文レビュー] SHAFF: Fast and consistent SHApley eFfect estimates via random Forests

Clément Bénard, Gérard Biau|arXiv (Cornell University)|May 25, 2021
Explainable Artificial Intelligence (XAI)参考文献 29被引用数 16
ひとこと要約

SHAFF は、再訓練を回避するための重要度サンプリングとプロジェクション付きフォレストを活用し、ランダムフォレストを用いてシャープレー効果を高速かつ一貫して推定する手法である。従来の再訓練を要しない手法として、従属変数が存在する状況でも高い精度を達成し、再訓練なしに一貫性が保証された最初の手法である。

ABSTRACT

Interpretability of learning algorithms is crucial for applications involving critical decisions, and variable importance is one of the main interpretation tools. Shapley effects are now widely used to interpret both tree ensembles and neural networks, as they can efficiently handle dependence and interactions in the data, as opposed to most other variable importance measures. However, estimating Shapley effects is a challenging task, because of the computational complexity and the conditional expectation estimates. Accordingly, existing Shapley algorithms have flaws: a costly running time, or a bias when input variables are dependent. Therefore, we introduce SHAFF, SHApley eFfects via random Forests, a fast and accurate Shapley effect estimate, even when input variables are dependent. We show SHAFF efficiency through both a theoretical analysis of its consistency, and the practical performance improvements over competitors with extensive experiments. An implementation of SHAFF in C++ and R is available online.

研究の動機と目的

  • 高次元設定における正確なシャープレー効果推定の計算不能性(指数的複雑性)に対処する。
  • 入力変数が従属である場合に既存のシャープレー推定手法に生じるバイアスを克服する。
  • ランダムフォレストに特化した、高速で一貫性があり実用的なシャープレー効果推定アルゴリズムを開発する。
  • 解釈可能な機械学習における正確な変数重要度評価を可能にし、医療分野などハイリスク応用分野に貢献する。
  • プロジェクション付きフォレストを活用して、グローバルおよびローカル解釈を両立する SHAP 値への拡張を可能にするフレームワークを提供する。

提案手法

  • 重要度サンプリングを用いて、ランダムフォレストのパスに沿った変数サブセットの優先順位を決定し、必要な条件付き分散推定回数を削減する。
  • プロジェクション付きフォレストアルゴリズムを適用し、任意の変数サブセットに対する条件付き期待値を再訓練なしに効率的に計算する。
  • ランダムフォレストの構造を活用して、一度のフォレストフィットで全サブセット $U$ に対して $\mathbb{V}[\mathbb{E}[Y|\mathbf{X}^{(U)}]]$ を推定する。
  • すべてのサブセットに対する不偏平均化を保証するため、組み合わせ的重み $\frac{1}{p} \binom{p-1}{|U|}^{-1}$ を推定に統合する。
  • やや弱い正則性条件の下で推定量の一貫性を証明し、モデル再訓練なしに理論的保証を確立する。
  • ranger で実装されている条件付き平均に基づく順序付きカテゴリカルスプリットを用いて、カテゴリカル変数への拡張を実現する。

実験結果

リサーチクエスチョン

  • RQ1ランダムフォレストを用いて、従属入力変数に対しても高速かつ一貫性のあるシャープレー効果推定が可能か?
  • RQ2シャープレー推定において複数回のモデル再訓練を回避することで、精度と一貫性が維持されるか?
  • RQ3TreeSHAP や SAGE、pMC といった最先端手法と比較して、SHAFF の誤差と実行時間はどの程度か?
  • RQ4多くのカテゴリを持つカテゴリカル変数において、MDI がバイアスを示すことが知られている状況で、SHAFF はシャープレー効果を正確に推定できるか?
  • RQ5プロジェクション付きフォレストアプローチは、すべての変数サブセットに対して高速かつ正確な条件付き期待値推定を可能にするか?

主な発見

  • pMC/Forest 実験では、SHAFF が累積絶対誤差(0.19)を最低に抑え、TreeSHAP や SAGE を上回った。
  • カテゴリカル変数実験では、SHAFF は $X^{(5)}$ および $X^{(6)}$ のシャープレー効果を正しくゼロと推定したが、MDI や SAGE は高基数変数に強くバイアスを示した。
  • pMC/Projected-RF 実験でも、SHAFF は低誤差(0.29)を維持し、条件付き期待値推定の堅牢性を示した。
  • 競合手法と比較して著しく高速に動作し、複数回の再訓練を要する手法とは異なり、一度のフォレストフィットで済ませられる。
  • SHAFF は、やや弱い仮定の下で、再訓練なしに一貫性が保証された最初のシャープレー推定手法である。
  • プロジェクション付きフォレストによる条件付き予測の可用性のおかげで、SHAP 値への自然な拡張が可能となった。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。