[論文レビュー] Explaining a Series of Models by Propagating Shapley Values
DeepSHAP は、ゲーム理論に裏打ちされた理論的枠組みに基づき、モデルパイプライン全体にわたりシャープレー値を伝播させることで、複雑な機械学習モデルの系列を高速かつスケーラブルに説明する手法である。深層学習、線形、木構造ベースのアーキテクチャを含む多様なモデルに対して、効率的かつ正確な帰属割り当てを可能にするとともに、モデルが別々の機関に所有されている分散環境でも対応でき、モデルに依存しない手法と比較して速度で1桁の優位性を示す。
Local feature attribution methods are increasingly used to explain complex machine learning models. However, current methods are limited because they are extremely expensive to compute or are not capable of explaining a distributed series of models where each model is owned by a separate institution. The latter is particularly important because it often arises in finance where explanations are mandated. Here, we present DeepSHAP, a tractable method to propagate local feature attributions through complex series of models based on a connection to the Shapley value. We evaluate DeepSHAP across biological, health, and financial datasets to show that it provides equally salient explanations an order of magnitude faster than existing model-agnostic attribution techniques and demonstrate its use in an important distributed series of models setting.
研究の動機と目的
- 特にモデルが別々の機関に所有されている分散環境において、効率的でスケーラブルなモデル系列の説明手法が不足しているという問題に対処すること。
- モデルに依存しない手法の限界を克服すること。これらの手法は計算コストが高く、モデルの完全なアクセスを必要とする。
- 深層学習や木構造モデル向けのモデル固有の帰属割り当て手法を、連結されたモデルパイプライン全体に拡張すること。
- 各モデル層における特徴の帰属割り当ての効率性と一貫性を保証する理論的根拠に基づく枠組みを提供すること。
- 金融や医療など、モデルの透明性が義務付けられる高リスク分野において、実用的で解釈可能な説明を可能にすること。
提案手法
- DeepLIFT の規則とシャープレー値の間の接続を、介入的条件付き期待値集合関数を通じて提案し、ICE シャープレー値を導入する。
- ICE シャープレー値が単一のベースライン帰属割り当ての平均に分解されることを導出し、計算の効率化を実現する。
- 各層で効率性を保ちつつ、一連のモデルを通過する帰属割り当てを伝播させるための一般化されたスケーリング則を導入する。
- 高次元入力の解釈性を向上させるために、特徴グループへの帰属割り当てを可能にするグループスケーリング則を提案する。
- 単一のベースラインではなく複数のベースラインサンプルを用いることで、帰属割り当て推定のバイアスを低減し、耐性を向上させる。
- 帰属割り当て値に基づく特徴の順序付けに基づいたアブレーションテストを実施し、帰属割り当ての正しさを検証する。

実験結果
リサーチクエスチョン
- RQ1シャープレー値をモデル系列全体に効率的に伝播させることで、分散環境における局所的説明が可能になるか?
- RQ2単一のベースラインではなく複数のベースラインサンプルを用いることで、帰属割り当ての品質とバイアスにどのような影響があるか?
- RQ3線形、深層学習、木構造ベースの多様なモデルタイプを統一した枠組みで1つのパイプライン内で説明可能か?
- RQ4モデルに依存しない手法と比較して、計算コストを著しく削減しつつも、説明の忠実度を維持できるか?
- RQ5高次元特徴集合の解釈性を向上させるために、グループレベルの帰属割り当てをサポートできるか?
主な発見
- DeepSHAP は、モデルに依存しない手法と同等の説明の明確さを提供するが、最大で1桁の高速化を達成し、実世界のパイプラインにおける実用的導入を可能にする。
- モデルに依存しない手法がモデルへの完全なアクセスができないため失敗するような、消費者信用スコアを入力として使用する分散モデル系列の説明に成功している。
- 単一ベースライン帰属割り当てと比較して、複数のベースラインサンプルを用いることでバイアスが低減され、特にベースラインがデータ分布を代表していない場合に顕著である。
- ゲノムデータにおける生物学的に意味のある遺伝子群に基づくグループ帰属割り当ては、先行研究と強く整合しており、解釈性の妥当性を裏付けている。
- アブレーションテストにより、DeepSHAP が帰属割り当てで上位にランク付けした特徴は、モデル出力に強く単調な影響を持つことが確認され、最も重要な特徴を除去すると予測値が最も大きく低下する。
- DeepSHAP は、理論的整合性と計算効率を両立させつつ、複雑で多機関にまたがるモデルパイプラインの完全な説明を可能にする、現時点で知られている唯一の手法である。

より良い研究を、今すぐ始めましょう
論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。
クレジットカード登録不要
このレビューはAIが作成し、人間の編集者が確認しました。