[論文レビュー] Challenging common interpretability assumptions in feature attribution explanations
この論文は、機械学習における特徴量の寄与度説明に関する、広く受け入れられている3つの仮説に挑戦する。すなわち、単純なモデルがより解釈可能である、モデルに依存しない説明が普遍的に効果的である、そしていかなる説明も意思決定を改善するという仮説である。アマゾンのMechanical Turkを用いた大規模な被験者実験を通じて、著者たちは特徴量の寄与度説明がわずかな利益しかもたらさず、認知的および文脈的要因の干渉により意思決定を損なう可能性があることを発見した。これは、人間を含むシステムにおけるこのような説明の普遍的価値が、疑わしいものであることを示している。
As machine learning and algorithmic decision making systems are increasingly being leveraged in high-stakes human-in-the-loop settings, there is a pressing need to understand the rationale of their predictions. Researchers have responded to this need with explainable AI (XAI), but often proclaim interpretability axiomatically without evaluation. When these systems are evaluated, they are often tested through offline simulations with proxy metrics of interpretability (such as model complexity). We empirically evaluate the veracity of three common interpretability assumptions through a large scale human-subjects experiment with a simple "placebo explanation" control. We find that feature attribution explanations provide marginal utility in our task for a human decision maker and in certain cases result in worse decisions due to cognitive and contextual confounders. This result challenges the assumed universal benefit of applying these methods and we hope this work will underscore the importance of human evaluation in XAI research. Supplemental materials -- including anonymized data from the experiment, code to replicate the study, an interactive demo of the experiment, and the models used in the analysis -- can be found at: https://doi.pizza/challenging-xai.
研究の動機と目的
- 後から得られる特徴量の寄与度説明に関する、3つの一般的な解釈可能性の仮説の妥当性を、実証的に評価すること。
- 高リスクかつ現実に近い状況下で、特徴量の寄与度説明が人間の意思決定を改善するかどうかを評価すること。
- 異なるデータのスパarsityレベルおよびユーザー層において、モデルに依存しない説明が普遍的に有益であるかどうかを調査すること。
- XAI研究において、解釈可能性の代わりにモデルの複雑さなどの代理指標を用いることの問題を提起すること。
- 代理指標による検証の限界を鑑み、人間中心の評価の重要性を強調すること。
提案手法
- 300名の参加者を対象に、アマゾンのMechanical Turk上で混合被験者間/被験者内反復測定実験を実施した。
- 参加者が順位付けされた特徴量の重要度に基づいて2つのモデルを比較する住宅価格予測タスクを用いた。
- 実際の説明の効果を隔離するために、プラセボ説明の制御条件を採用した。
- 個人の能力と課題の難易度パラメータを推定するために、ベイジアン階層モデルを適用し、個人およびデータインスタンスごとのばらつきを捉えた。
- LIME、SHAP、Ridge、およびプラセボ制御の4つの説明手法を、2つのデータスパarsity条件で評価した。
- 説明タイプ、特徴量数、データスパarsityが意思決定の正確性に与える影響を検証するために統計的モデリングを用いた。
実験結果
リサーチクエスチョン
- RQ1特徴量の寄与度説明を提供することで、説明なしと比較して人間の意思決定の正確性が向上するか?
- RQ2人間を含むモデル選択の文脈において、プラセボや説明なしと比較して、モデルに依存しない説明に明確な利益があるか?
- RQ3データスパarsityが、異なる説明手法の意思決定支援効果にどのように影響するか?
- RQ4説明に含まれる特徴量の数が、ユーザーがより良い性能を示すモデルを識別する能力に影響を与えるか?
- RQ5個人差および課題レベルのばらつきが、説明の有用性の認識にどの程度影響を及えるか?
主な発見
- 特徴量の寄与度説明は、プラセボ制御と比較して意思決定の正確性にわずかな改善しかもたらさず、統計的に有意な利益は認められなかった。
- 特にスパースなデータセット上では、特徴量の寄与度説明が説明なしよりも悪い意思決定をもたらす場合があり、認知的干渉の可能性を示唆した。
- ユーザーがより良い性能を示すモデルを特定する能力に、特徴量の数の有意な影響は認められなかった(β = 0.02、95%信頼区間 = [-0.03, 0.06])。
- データスパarsityに応じて説明手法の有効性が逆転した:スパースデータではSHAPがRidgeを上回ったが、Ridgeは予想より劣った性能を示した。
- 課題難易度(易しさ)パラメータは、個人の能力よりも高い分散を示しており、説明の有用性に強い課題固有の混同要因が存在することを示した。
- 本研究では、ユーザーのパフォーマンスおよび課題難易度に顕著な異質性が認められ、ユーザーおよびデータインスタンス全体にわたる一様な解釈可能性の仮定が疑わしいものであると示された。
より良い研究を、今すぐ始めましょう
論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。
クレジットカード登録不要
このレビューはAIが作成し、人間の編集者が確認しました。