Skip to main content
QUICK REVIEW

[論文レビュー] How can we fool LIME and SHAP? Adversarial Attacks on Post hoc Explanation Methods.

Dylan Slack, Sophie Hilgard|arXiv (Cornell University)|Nov 6, 2019
Explainable Artificial Intelligence (XAI)参考文献 11被引用数 29
ひとこと要約

本稿では、後処理説明手法(LIME や SHAP など)が、偏見のある分類器を改ざんすることで一見公平に見える説明を生成する「敵対的スカフォールディング」によって体系的にだまされうることを示している。偏見のある分類器が改ざんされても、有害なバイアスを保持したまま、誤ったほど公平に見える説明を生成する。著者らは、極端に差別的な分類器ですら説明ツールから隠蔽され、高リスクなAIシステムにおけるバイアス検出に役立たないことを示している。

ABSTRACT

As machine learning black boxes are increasingly being deployed in domains such as healthcare and criminal justice, there is growing emphasis on building tools and techniques for explaining these black boxes in an interpretable manner. Such explanations are being leveraged by domain experts to diagnose systematic errors and underlying biases of black boxes. In this paper, we demonstrate that post hoc explanations techniques that rely on input perturbations, such as LIME and SHAP, are not reliable. Specifically, we propose a novel scaffolding technique that effectively hides the biases of any given classifier by allowing an adversarial entity to craft an arbitrary desired explanation. Our approach can be used to scaffold any biased classifier in such a way that its predictions on the input data distribution still remain biased, but the post hoc explanations of the scaffolded classifier look innocuous. Using extensive evaluation with multiple real-world datasets (including COMPAS), we demonstrate how extremely biased (racist) classifiers crafted by our framework can easily fool popular explanation techniques such as LIME and SHAP into generating innocuous explanations which do not reflect the underlying biases.

研究の動機と目的

  • LIME や SHAP といった後処理説明手法が、モデルバイアスを検出する信頼性について調査すること。
  • 入力の摂動に依存する説明技術に内在する脆弱性を暴露すること。
  • 悪意ある実体が、予測性能を維持したままモデルバイアスを隠すためのフレームワークを開発すること。
  • LIME や SHAP において、極めて偏見の強い分類器ですら無害な説明を生成できることを実証すること。
  • 後処理説明がモデル行動の偏見のない診断として信頼できるという仮定に疑問を呈すること。

提案手法

  • 著者らは、偏見のある分類器を改ざんし、LIME や SHAP といった説明手法が代表的とみなすような入力を生成するスカフォールディング技術を導入した。
  • スカフォールディングされたモデルは、元のデータ分布上で高い精度を維持するように訓練され、説明手法で用いられる摂動が一様に分布し、差別的でない特徴重要度スコアを生じるように保証された。
  • 敵対的訓練を用いて、モデルの局所的説明が実際の意思決定プロセスとは無関係に望ましい、無害な説明パターンと一致するようにした。
  • 実世界のデータセット(COMPAS を含む)にこのフレームワークを適用し、犯罪裁判のリスク評価のような高リスクなシナリオを模擬した。
  • モデルの予測は偏見を保ちつつも、後処理説明では公平に見えるようにした。
  • LIME や SHAP が入力摂動に敏感であるという特徴を活用し、局所線形近似に依存する性質を利用して、潜在的なバイアスを隠蔽した。

実験結果

リサーチクエスチョン

  • RQ1敵対的スカフォールディングを用いて、予測性能を維持したまま分類器内の系統的バイアスを隠蔽できるか?
  • RQ2LIME や SHAP は、偏見のあるモデルに対してどれほど無害な説明を生成するようにだまされるのか?
  • RQ3スカフォールディング技術は、標準的な説明ツールにおいて偏見のあるモデルをどれほど公平に見えるようにするのか?
  • RQ4このフレームワークは、犯罪裁判や医療など高リスクなインパクトを持つ実世界のデータセットに適用可能か?
  • RQ5後処理説明手法に依存してモデルの公平性を監査する際の限界は何か?

主な発見

  • 提案されたスカフォールディング技術は、COMPAS に類似した分類器における極端な人種的バイアスを、元のデータにおける高い予測精度を維持したまま隠蔽できた。
  • LIME や SHAP は、スカフォールディングされたモデルに対して一様に分布し、差別的でない特徴重要度スコアを生成し、誤って公平性を示唆した。
  • 元の分類器が明確な人種的差別を示していたにもかかわらず、複数の評価指標を通じて後処理説明は無害で偏見のないものに見えた。
  • このフレームワークは、説明ツールがモデルの公平性を独立した検証手段として信頼できないことを示しており、潜在的なバイアスを隠蔽できる可能性がある。
  • 結果として、後処理説明手法が敵対的攻撃に対して脆弱であることが示され、高リスクなAIシステムの監査におけるその有用性が損なわれることになった。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。