Skip to main content
QUICK REVIEW

[論文レビュー] SurvSHAP(t): Time-dependent explanations of machine learning survival models

Mateusz Krzyziński, Mikołaj Spytek|arXiv (Cornell University)|Aug 23, 2022
Explainable Artificial Intelligence (XAI)被引用数 8
ひとこと要約

本稿では、シャープリー値を用いた、時間に依存する解釈可能な手法 SurvSHAP(t) を紹介する。これは、機械学習生存モデルにおける、モデルに依存しない最初の時間に依存する解釈手法である。特徴量の局所的かつ時間に依存する寄与度を生存関数予測に与えるもので、時間に依存する効果を検出する点で SurvLIME を上回り、より正確な局所的特徴量重要度の順序付けを提供する。

ABSTRACT

Machine and deep learning survival models demonstrate similar or even improved time-to-event prediction capabilities compared to classical statistical learning methods yet are too complex to be interpreted by humans. Several model-agnostic explanations are available to overcome this issue; however, none directly explain the survival function prediction. In this paper, we introduce SurvSHAP(t), the first time-dependent explanation that allows for interpreting survival black-box models. It is based on SHapley Additive exPlanations with solid theoretical foundations and a broad adoption among machine learning practitioners. The proposed methods aim to enhance precision diagnostics and support domain experts in making decisions. Experiments on synthetic and medical data confirm that SurvSHAP(t) can detect variables with a time-dependent effect, and its aggregation is a better determinant of the importance of variables for a prediction than SurvLIME. SurvSHAP(t) is model-agnostic and can be applied to all models with functional output. We provide an accessible implementation of time-dependent explanations in Python at http://github.com/MI2DataLab/survshap.

研究の動機と目的

  • 複雑な生存モデル、特にブラックボックスでデフォルトでは解釈不能なモデルに対して、時間に依存する解釈手法が不足しているという問題に対処すること。
  • SurvLIME などの既存手法の制限を克服すること。SurvLIME は特徴量効果が時間に依存しないと仮定しており、時間経過に伴う動的な変数の影響を捉えることができない。
  • 生存関数の出力をもつモデルに対して、理論的根拠に基づいたモデルに依存しない解釈フレームワークを提供すること。生存関数予測の局所的正確性を保証する。
  • 医療分野のドメインエキスパートが、ランダム生存フォレスト やディープラーニング生存モデルなどの高度なモデルの予測を解釈・検証できるようにすること。
  • 時間分解能のある直感的な可視化により、生存解析における機械学習の信頼性と採用を促進すること。

提案手法

  • シャープリー値を生存関数の出力に適応することで、SHapley Additive exPlanations (SHAP) を生存モデルに拡張する。具体的には、生存関数の時間的変化を説明するためのシャープリー値を定式化する。
  • 各特徴量について、時間ごとに時間に依存するシャープリー値を計算し、その和が各時刻におけるモデルの生存関数予測値に一致するようにする。
  • すべての可能な特徴量の合同(コалиション)を考慮しつつ、局所的正確性を保ちながら、シャープリー値をモンテカルロ近似で効率的に推定する。
  • ランダム生存フォレスト やディープラーニングモデルを含む、任意の機能的出力をもつ生存モデルに適用可能であり、モデル固有の変更を必要としない。
  • 時間範囲にわたって時間に依存する寄与度を統合することで、生存曲線全体における特徴量の影響を比較可能なグローバル重要度スコアに集約する。
  • 実装の基盤として scikit-survival Python パッケージを採用し、既存の生存モデリングワークフローとの互換性を確保する。

実験結果

リサーチクエスチョン

  • RQ1モデルに依存しない解釈手法は、生存モデルの予測に対して、時間に依存する寄与度を提供できるか。具体的には、特徴量効果が時間経過とともにどのように変化するかを捉えられるか。
  • RQ2SurvSHAP(t) は、生存結果に時間に依存する効果をもつ特徴量を検出する点で、SurvLIME を上回るか。
  • RQ3SurvSHAP(t) は、各時刻における特徴量寄与度の和が、正確にモデルの生存関数予測値に一致するか。
  • RQ4時間に依存するシャープリー値の集約は、SurvLIME の係数ベースの重要度と比較して、主要な予測因子を特定する点で優れているか。
  • RQ5SurvSHAP(t) は、アーキテクチャの変更なしに、ランダム生存フォレスト やディープラーニング生存モデルといった複雑なモデルに適用可能か。

主な発見

  • SurvSHAP(t) は、特徴量の時間に依存する効果を正確に捉え、SurvLIME が時間に依存しない効果を仮定しているため、その効果を検出できない点を補っている。
  • SurvSHAP(t) の時間に依存する値の統合は、SurvLIME の係数ベースのアプローチに比べ、より正確で信頼性の高い局所的特徴量重要度の測定を提供する。
  • SurvSHAP(t) は局所的正確性の性質を満たしており、各時刻における特徴量寄与度の和が正確にモデルの生存関数予測値に一致することを保証する。
  • 合成データおよび実際の医療データを用いた実験により、SurvSHAP(t) が、生存に与える影響が時間経過とともに変化する特徴量を正しく同定できることを確認した。
  • 本手法は、ランダム生存フォレスト やディープラーニングモデルを含む、任意の機能的出力をもつ生存モデルに適用可能であり、広範なモデルに依存しない有用性を示している。
  • オープンソースの Python 実装が提供されており、scikit-survival ライブラリを用いた既存の生存モデリングパイプラインへの即時統合が可能である。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。