[論文レビュー] Rethinking Stability for Attribution-based Explanations
本稿では、モデルの入力、表現、出力に対する摂動に対する説明の変化を測定することで、帰属に基づく説明手法の評価に相対的安定性指標を導入する。3つの実世界データセットにおける7つの手法において、SmoothGradが平均12.7%の安定性で他を上回り、最も安定した説明を生成することを示している。
As attribution-based explanation methods are increasingly used to establish model trustworthiness in high-stakes situations, it is critical to ensure that these explanations are stable, e.g., robust to infinitesimal perturbations to an input. However, previous works have shown that state-of-the-art explanation methods generate unstable explanations. Here, we introduce metrics to quantify the stability of an explanation and show that several popular explanation methods are unstable. In particular, we propose new Relative Stability metrics that measure the change in output explanation with respect to change in input, model representation, or output of the underlying predictor. Finally, our experimental evaluation with three real-world datasets demonstrates interesting insights for seven explanation methods and different stability metrics.
研究の動機と目的
- 高利害な機械学習応用における帰属に基づく説明の不安定性を解消すること。特に、小さな入力変更が説明の大幅なシフトを引き起こす問題に焦点を当てる。
- 従来の安定性指標が入力摂動のみを考慮し、モデルの内部構造を無視するという限界を克服すること。
- モデルの挙動を組み込んだ新しい安定性指標—相対的入力安定性、相対的表現安定性、相対的出力安定性—を提案・検証すること。
- 複数のデータセットと予測モデルを用いて、7つの最先端の説明手法の安定性を実験的に比較すること。
- 説明の不安定性とモデルのリプシッツ定数、表現安定性との間の理論的境界を確立すること。
提案手法
- 相対的安定性指標を提案:相対的入力安定性(RIS)、相対的表現安定性(RRS)、相対的出力安定性(ROS)。それぞれが入力、表現、出力の摂動に対する説明の変化を測定する。
- モデルの入力から隠れ層へのリプシッツ定数とRRSの積を用いて、RISの理論的上限を導出。これにより、モデルの性質と説明の安定性の間の正式な関係を確立する。
- 50個の無限小摂動を各テストインスタンスに対して生成し、7つの説明手法における説明の変化を測定することで、安定性を実験的に評価する。
- 予測モデルとしてロジスティック回帰と人工ニューラルネットワークを用い、説明はVanillaGrad、Integrated Gradients、SmoothGrad、Input×Gradients、LIME、SHAP、およびランダムベースラインで生成する。
- 元の説明と摂動後の説明との間のL2ノルム差を摂動の大きさで正規化することで、不安定性を定量化する。
- 理論的境界の妥当性を検証するため、モデルアーキテクチャと表現安定性から導出された理論的上限と、実験的RIS値を比較する。
実験結果
リサーチクエスチョン
- RQ1従来の安定性指標は、特に内部表現との関係において、モデルレベルの挙動を十分に捉えていないのはどのような点か?
- RQ2帰属に基づく説明手法は、無限小の入力、表現、出力摂動に対してどの程度安定しているか?
- RQ3説明の不安定性を、リプシッツ定数などのモデル固有の性質と関連付ける理論的境界を導出できるか?
- RQ4どの説明手法が複数の安定性バリエーションおよびデータセットにおいて最も頑健な性能を示すか?
- RQ5安定性指標は入力、表現、出力の変化に対してどのように感度を示し、説明の信頼性に関する何らかのインサイトを提供するか?
主な発見
- RISスコアはRRSおよびROSよりも一貫して低く、入力摂動が説明差の正規化に強い効果をもたらしていることを示している。
- RISの理論的上限は実験的に妥当であり、平均して実測値より233%高いが、上限はきわめてタイトであることが判明した。
- SmoothGradはすべてのデータセットおよび安定性バリエーションで最高の安定性を示し、他の手法と比較して中央値の不安定性で平均12.7%優れていた。
- 表現および出力安定性指標(RRSおよびROS)は、モデルの内部構造が説明の安定性に顕著に影響していることを明らかにした。これにより、入力摂動以外のモデル挙動を考慮する必要性が強調された。
- どの説明手法も完全に安定しているわけではないが、SmoothGradはAdult、Compas、German Creditの複数のデータセットおよび予測モデル(LRおよびANN)において、最も一貫した頑健性を示した。
- 理論的分析により、説明の不安定性がモデルの入力から隠れ層へのリプシッツ定数と表現安定性の積によって上限づけられることを確認した。これにより、安定性評価の正式な基盤が得られた。
より良い研究を、今すぐ始めましょう
論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。
クレジットカード登録不要
このレビューはAIが作成し、人間の編集者が確認しました。