[論文レビュー] Deletion and Insertion Tests in Regression Models
この論文は、画像分類のための挿入・削除テストを、予測が連続的でかつゼロに近いとは限らない回帰モデルへと拡張し、アンカード分解を用いて主効果および相互作用項を用いて受容器操作特性曲線下積分(AUC)および曲線上積分(ABC)の解析的表現を導出する。IG(Integrated Gradients)は、KS(Kernel SHAP)と同等の特徴重要度順序付け性能を示すが、特に2値変数ではIGが離散的レベル間の補間を必要とするため、計算がはるかに高速であることが判明した。
A basic task in explainable AI (XAI) is to identify the most important features behind a prediction made by a black box function $f$. The insertion and deletion tests of Petsiuk et al. (2018) can be used to judge the quality of algorithms that rank pixels from most to least important for a classification. Motivated by regression problems we establish a formula for their area under the curve (AUC) criteria in terms of certain main effects and interactions in an anchored decomposition of $f$. We find an expression for the expected value of the AUC under a random ordering of inputs to $f$ and propose an alternative area above a straight line for the regression setting. We use this criterion to compare feature importances computed by integrated gradients (IG) to those computed by Kernel SHAP (KS) as well as LIME, DeepLIFT, vanilla gradient and input$ imes$gradient methods. KS has the best overall performance in two datasets we consider but it is very expensive to compute. We find that IG is nearly as good as KS while being much faster. Our comparison problems include some binary inputs that pose a challenge to IG because it must use values between the possible variable levels and so we consider ways to handle binary variables in IG. We show that sorting variables by their Shapley value does not necessarily give the optimal ordering for an insertion-deletion test. It will however do that for monotone functions of additive models, such as logistic regression.
研究の動機と目的
- 画像分類から回帰問題へ挿入・削除テストを拡張すること。回帰では予測値が連続的であり、かつ必ずしもゼロに近いとは限らない。
- 回帰関数のアンカード分解を用いて、主効果および相互作用項の観点からAUCおよびABC指標の解析的表現を導出すること。
- IG、KS、LIME、DeepLIFT、バニラ勾配、入力×勾配といった複数の説明可能AI手法の回帰タスクにおける性能を評価・比較すること。
- 変数タイプ(特に2値変数)がIGの性能に与える影響を調査し、その対処法を提案すること。
- シャープレー値で特徴をソートすることで挿入/削除テストの性能が最適化されるかを検証し、その条件を同定すること。
提案手法
- 回帰関数f(x)のアンカード分解を用い、AUCおよびABCを主効果および相互作用項で表現する。
- ランダムな変数順序での期待AUCを導出し、比較のためのベースラインを確立する。
- 分類問題で用いられる水平軸の代わりに、回帰におけるABCのための基準線(直線)を提案する。
- 2つのデータセット(バンガロールの住宅価格、CERNの電子衝突データ)に挿入/削除テストを適用する。
- IGにおける2値変数の処理として、0と1の間を補間するという、最も単純な戦略を採用する。
- 再訓練を伴うROARスタイルの特徴除去実験において、符号付きおよび絶対値付きの帰属値を用いて手法を比較する。
実験結果
リサーチクエスチョン
- RQ1挿入・削除テストを分類設定から回帰設定へ意味的に拡張するにはどうすればよいか?
- RQ2回帰におけるAUCおよびABC指標を支配する解析的表現は何か? そしてそれらは関数の主効果および相互作用項とどのように関係するか?
- RQ3シャープレー値で特徴をソートすることで挿入/削除テストの性能が最適化されるか? もし最適化されない場合、どのような条件下で失敗するのか?
- RQ4IG、KS、LIMEなどの異なる説明可能AI手法が、回帰タスクにおける挿入/削除指標を用いてどのように比較されるか?
- RQ52値変数がIGの性能に与える影響は何か? そして、この文脈で効果的に処理するにはどうすればよいか?
主な発見
- Integrated Gradients(IG)は、計算がはるかに高速であるにもかかわらず、挿入および削除テストの両方において、Kernel SHAP(KS)とほぼ同等の性能を示す。
- KSは両データセットで最高の全体的なAUCおよびABCスコアを達成しているが、大規模な用途には計算コストが高すぎて実用的でない。
- 絶対値付きの帰属値を用いたIGは、符号付き順序付けを上回る性能を示す。特にバンガロールの住宅価格データセットでは、KSをも上回る。
- ROARテストの結果、IGおよびKSは明確な特徴重要度の階層を特定できず、損失曲線がほぼ直線的であることが判明した。これは、どの特徴サブセットを削除しても性能低下が著しくないことを示している。
- シャープレー値で特徴をソートしても、常に挿入/削除テストの性能が最適化されるわけではない。これは、ロジスティック回帰のような単調加法的モデルでのみ成立する。
- ランダム順序での期待ABCはゼロであるため、手法の性能評価のための帰無仮説基準として有効である。
より良い研究を、今すぐ始めましょう
論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。
クレジットカード登録不要
このレビューはAIが作成し、人間の編集者が確認しました。