[論文レビュー] How Much Can I Trust You? -- Quantifying Uncertainties in Explaining Neural Networks
本稿では、任意の既存の説明手法(例:LRP)をベイジアンニューラルネットワーク(BNN)に適応させることで、ニューラルネットワークの説明における不確実性を定量化する新規フレームワークB-LRPを提案する。BNNの事後分布からサンプリングすることで、B-LRPは説明の分布を生成し、パーセンタイルベースの信頼水準(例:5番目のパーセンタイルで保守的説明)を可能にする。これにより、サリエンシーマップにおける誤った関連性が顕著に低減され、信頼性が向上し、安全が求められる分野での応用に適する。
Explainable AI (XAI) aims to provide interpretations for predictions made by learning machines, such as deep neural networks, in order to make the machines more transparent for the user and furthermore trustworthy also for applications in e.g. safety-critical areas. So far, however, no methods for quantifying uncertainties of explanations have been conceived, which is problematic in domains where a high confidence in explanations is a prerequisite. We therefore contribute by proposing a new framework that allows to convert any arbitrary explanation method for neural networks into an explanation method for Bayesian neural networks, with an in-built modeling of uncertainties. Within the Bayesian framework a network's weights follow a distribution that extends standard single explanation scores and heatmaps to distributions thereof, in this manner translating the intrinsic network model uncertainties into a quantification of explanation uncertainties. This allows us for the first time to carve out uncertainties associated with a model explanation and subsequently gauge the appropriate level of explanation confidence for a user (using percentiles). We demonstrate the effectiveness and usefulness of our approach extensively in various experiments, both qualitatively and quantitatively.
研究の動機と目的
- 深層ニューラルネットワークの既存の説明手法における不確実性の定量化の欠如に対処すること。
- 特に安全が求められる分野において、説明の不確実性をモデル化することで、信頼に配慮した解釈を可能にすること。
- 任意の既存の説明手法(例:LRP)をベイジアンニューラルネットワークに拡張し、確率的出力となる説明を生成すること。
- ユーザーが説明の信頼性を調整可能な信頼水準(パーセンタイルを用いて)を提供すること、例えば5番目のパーセンタイルで高リスク判断に適した保守的説明を実現すること。
- 実験的に、不確実性を考慮した説明がサリエンシーマップにおける誤検出(偽陽性)を低減し、忠実度と信頼性を向上させることを検証すること。
提案手法
- BNNの事後分布からの知識蒸留により、任意の既存の説明手法にBNNからの不確実性を転送する。
- 各入力に対して、マルコフ連鎖モンテカルロ法や事後分布からのサンプリングを用いて、複数回の順方向伝搬を実行し、説明スコア(例:関連性マップ)の分布を生成する。
- 得られた説明の分布を用いてパーセンタイル(例:5番目、50番目、95番目)を計算し、リスクに応じた説明を可能にする。低いパーセンタイルでは、より保守的で信頼性の高い領域が得られる。
- このフレームワークをLRPに適用し、B-LRPを構築。これにより、単一のヒートマップではなく、関連性マップの分布を出力する。
- 不確実性を空間的に可視化し、高信頼度領域(赤)と低信頼度領域(青)を強調する。例えば、ガスランタンなど関係のない物体への誤った関連性を排除する。
- 本手法は汎用的であり、モデルに依存しないまたはモデルに依存する任意の説明手法および任意のBNNにおける近似推論手法と互換性がある。
実験結果
リサーチクエスチョン
- RQ1現在、決定的とみなされているニューラルネットワークの説明における不確実性を定量化することは可能か?
- RQ2ベイジアンニューラルネットワークを用いて、LRPのような既存の説明手法を不確実性を考慮した出力にどのように拡張できるか?
- RQ3パーセンタイルベースの説明閾値(例:5番目のパーセンタイル)を用いることで、サリエンシーマップにおける誤った関連性をどれほど効果的にフィルタリングできるか?
- RQ4不確実性を考慮した説明は、ピクセル反転や特徴重要度順位付けといった標準的な評価ベンチマークで性能向上をもたらすか?
- RQ5本手法により、「賢いハンス効果(Clever Hans effect)」を是正できるか?すなわち、学習データ内に存在する誤った特徴(例:ガスランタン)にモデルが依存するのを防ぎ、信頼性の高い特徴のみを強調できるか?
主な発見
- MNISTにおけるピクセル反転評価で、5番目のパーセンタイルB-LRPは標準的なLRPを上回り、x ≤ 12 の範囲で最も重要なピクセルのx%を正しく同定した。
- ImageNetでは、5番目のパーセンタイルB-LRPは関連性を城の物体にのみ割り当て、標準的なLRPとは異なり、ガスランタンポストへの誤った関連性を排除した。
- 高信頼度(5番目のパーセンタイル)の説明は視覚的および定量的にもより正確であり、誤った関連性の低減と忠実度の向上を確認した。
- B-LRPは、「賢いハンス効果」を効果的に明らかにした。標準的なLRPが学習データ内に存在するガスランタンのようなアーティファクトに誤って関連性を割り当てていたのを、本手法が是正した。
- 100個の事後分布サンプルで、粗いパーセンタイル分析に安定した不確実性推定が得られたが、より細かいパーセンタイル(例:1番目)ではサンプル数を増やす必要がある。
- 本手法は汎用的であり、任意の説明手法およびBNN推論手法に適用可能であり、多様な応用分野におけるリスクに配慮した解釈を可能にする。
より良い研究を、今すぐ始めましょう
論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。
クレジットカード登録不要
このレビューはAIが作成し、人間の編集者が確認しました。