Skip to main content
QUICK REVIEW

[論文レビュー] Impact of Accuracy on Model Interpretations

Brian Liu, Madeleine Udell|arXiv (Cornell University)|Nov 17, 2020
Explainable Artificial Intelligence (XAI)参考文献 14被引用数 10
ひとこと要約

本稿では、機械学習モデルにおける解釈品質を定量化する2つの指標、pMode と WKT10 を提案し、モデルの精度がこれらの指標に与える影響を調査している。サブサンプリングおよびブートストラップ実験を通じて、高精度のモデルでは、係数の絶対値順序によるロジスティック回帰といった単純な手法がより優れた解釈をもたらすのに対し、低精度のモデルでは、XGBoost に SHAP を組み合わせた手法が最も信頼性が高く安定した説明を提供することが判明した。

ABSTRACT

Model interpretations are often used in practice to extract real world insights from machine learning models. These interpretations have a wide range of applications; they can be presented as business recommendations or used to evaluate model bias. It is vital for a data scientist to choose trustworthy interpretations to drive real world impact. Doing so requires an understanding of how the accuracy of a model impacts the quality of standard interpretation tools. In this paper, we will explore how a model's predictive accuracy affects interpretation quality. We propose two metrics to quantify the quality of an interpretation and design an experiment to test how these metrics vary with model accuracy. We find that for datasets that can be modeled accurately by a variety of methods, simpler methods yield higher quality interpretations. We also identify which interpretation method works the best for lower levels of model accuracy.

研究の動機と目的

  • 予測精度がモデル解釈手法の記述的正確性に与える影響を調査すること。
  • 解釈品質を真正性と安定性の観点から定量化するための2つの新規指標、pMode と WKT10 の開発および妥当性検証。
  • さまざまなレベルのモデル精度において、どの解釈手法が最も信頼できる結果をもたらすかを特定すること。
  • データサイエンティストがモデルのパフォーマンスに応じて解釈手法を選択するための根拠に基づいた推奨事項を提供すること。
  • サブサンプリングおよびブートストラップを用いて、精度の変動に対する解釈のロバストネスをテストすることの重要性を示すこと。

提案手法

  • pMode を、真の特徴量順位を回復する確率を測定する指標として提案し、関数的プロキシに基づく形式化された上限を用いる。
  • WKT10 を、ブートストラップされたデータセット間での特徴量重要度順位の一貫性を評価することで、解釈の安定性を測定する指標として定義する。
  • サブサンプリングを用いて、複数の精度バケットにわたり、モデル精度を意図的に低下させ、予測性能の変動を模擬する。
  • 線形モデル、SHAP を用いた木構造モデル、LIME、MDI を含む、多様な解釈手法を、各精度レベルに適用する。
  • 各手法と精度の組み合わせに対して pMode と WKT10 を計算し、実験条件全体にわたる真正性と安定性を評価する。
  • ブートストラップによる再サンプリングを用いて、精度変動に対する解釈のロバストネスを推定する。

実験結果

リサーチクエスチョン

  • RQ1モデルの予測精度は、特徴量重要度の解釈の真正性と安定性にどのように影響するか?
  • RQ2異なる精度レベルにおいて、どの解釈手法が最も高品質な説明(真正性および安定性の観点から)を提供するか?
  • RQ3精度が低い状況において、ベースとなるモデルや解釈アルゴリズムの複雑さが解釈品質に与える影響は何か?
  • RQ4SHAP と LIME は、さまざまなモデル精度レベルにおいて、安定性と真正性の観点でどのように比較できるか?
  • RQ5サブサンプリングおよびブートストラップは、精度の摂動に対する解釈のロバストネスを効果的に評価するために使用できるか?

主な発見

  • 高精度でモデル化可能なデータセットでは、係数の絶対値順序によるロジスティック回帰(RCM)といった単純な解釈手法が、XGBoost に SHAP を組み合わせたような複雑なモデルよりも、より優れた解釈をもたらす。
  • モデル精度が低い場合、XGBoost に SHAP を組み合わせた手法が、あらゆる精度バケットにおいて優れた pMode および WKT10 スコアを示し、最も安定的かつ信頼性の高い解釈を提供する。
  • XGBoost に SHAP を組み合わせた手法は、低精度および中程度精度のバケットにおいて一様な解釈の安定性分布を示す一方で、他の手法は二峰性のパターンを示すため、より高いロバストネスを示している。
  • SHAP は、特にマージナル寄与の平均化による高い安定性のおかげで、局所的特徴量説明において LIME よりも、グローバル特徴量説明において MDI よりも一貫して優れている。
  • 真正性と安定性の両方の観点から測定した解釈品質は、モデル精度が向上するにつれて向上し、この傾向はグローバルおよびローカルの両方の説明タイプに共通して見られる。
  • 誤差帯(ブートストラップからの推定)を用いることで、データサイエンティストは精度の変動に伴う解釈の信頼性を評価し、効果的に伝えることができる。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。