Skip to main content
QUICK REVIEW

[論文レビュー] Fairwashing Explanations with Off-Manifold Detergent

Christopher J. Anders, Plamen Plasiliev|arXiv (Cornell University)|Jul 20, 2020
Explainable Artificial Intelligence (XAI)被引用数 35
ひとこと要約

本論文は、分類器の説明マップが出力を変更せずに任意に操作できることを証明し、説明をそのような操作に対してより堅牢にする接線空間投影を提案する。微分幾何学を用いた理論的証明を提供し、さまざまなタスクとアーキテクチャで実験的に検証する。

ABSTRACT

Explanation methods promise to make black-box classifiers more transparent. As a result, it is hoped that they can act as proof for a sensible, fair and trustworthy decision-making process of the algorithm and thereby increase its acceptance by the end-users. In this paper, we show both theoretically and experimentally that these hopes are presently unfounded. Specifically, we show that, for any classifier $g$, one can always construct another classifier $ ilde{g}$ which has the same behavior on the data (same train, validation, and test error) but has arbitrarily manipulated explanation maps. We derive this statement theoretically using differential geometry and demonstrate it experimentally for various explanation methods, architectures, and datasets. Motivated by our theoretical insights, we then propose a modification of existing explanation methods which makes them significantly more robust.

研究の動機と目的

  • 標準的な説明がモデルの決定を忠実に反映していない可能性を動機付ける。
  • 多様体仮定の下で説明マップの操作性を理論的に証明する。
  • パフォーマンスを維持しつつ、操作された説明が元の説明と乖離することを実験的に示す。
  • データ多様体の接線空間への射影に基づく頑健な説明法を提案・検証する。

提案手法

  • 微分幾何学を用いて、説明をデータ多様体の外側へ拡張して任意の目標に一致させつつ、データ上でのモデル挙動を変えないことを示す。
  • R^Dに埋め込まれたd次元データ多様体Sに対して、Sに直交する説明は不定であり、epsilon = d/Dの境界内で任意のターゲット説明を再現するように制御できることを証明する。
  • 接線空間投影(tsp)説明を、勾配をデータ多様体の接線空間へ射影することによって定義する。
  • 高次元でのtsp説明の接線空間を推定する実用的手法(Hyperplane法と自己符号化器ベース法)を提供する。
  • MNIST、FashionMNIST、CIFAR-10上のロジスティック回帰および深層ネットワークの説明を実験的に操作し、SSIM、PCC、MSE、KLダイバージェンスによる評価を示しつつ堅牢な操作性を検証する。

実験結果

リサーチクエスチョン

  • RQ1データ多様体上の予測を変えずに、分類器の説明を操作できるか。
  • RQ2埋め込み空間に対するデータ多様体の次元が説明の manipulability にどのように影響するか?
  • RQ3接線空間投影された説明は manipulation に対してより頑健であるか?
  • RQ4複雑なデータセットとモデルに対して、実践的に接線空間投影をどのように推定できるか?
  • RQ5tsp 説明は、勾配、x ∘ Grad、Integrated Gradients、LRP などの説明タイプやタスクを横断して一般化するか?

主な発見

  • 説明はターゲット説明と高い類似性で密着するように操作でき(SSIMは約0.8程度)、モデルの出力はほぼ同一のまま(出力MSEは約1e-3程度)に保てる。
  • 操作はデータ多様体に直交する方向に影響を及ぼす;多様体に接する勾配は元のモデルと操作後のモデルで一貫している。
  • 接線空間投影説明は操作に対して著しく頑健であり、データ多様体上で測定した場合、元の説明と操作後の説明の類似性が高い。
  • 平坦な部分多様体でのロジスティック回帰では、法線方向で決定境界を変更してもtsp説明は同一のままである(Pw-射影勾配)。
  • 接線空間を推定する現実的な方法として、k近傍を用いるハイパープレーン法とヤコビ行列の特異値分解を用いる自己符号化器ベース法の2手法を提案し、さまざまなデータセットでtsp説明を可能にする。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。