Skip to main content
QUICK REVIEW

[論文レビュー] Robust and Stable Black Box Explanations

Himabindu Lakkaraju, Nino Arsov|arXiv (Cornell University)|Nov 12, 2020
Explainable Artificial Intelligence (XAI)参考文献 45被引用数 5
ひとこと要約

本稿では、ブラックボックスモデルの後向き解釈を強靱かつ安定させるための新しい敵対的訓練フレームワークであるROPEを提案する。入力と分布に対する敵対的摂動の最小最大化目的関数を最適化することで、ROPEは分布シフトや小さな入力摂動に対しても高い忠実性を維持する解釈を生成する。実世界および合成データセットにおいて、LIME、SHAP、MUSEと比較して、強靱性と安定性において顕著に優れている。

ABSTRACT

As machine learning black boxes are increasingly being deployed in real-world applications, there has been a growing interest in developing post hoc explanations that summarize the behaviors of these black boxes. However, existing algorithms for generating such explanations have been shown to lack stability and robustness to distribution shifts. We propose a novel framework for generating robust and stable explanations of black box models based on adversarial training. Our framework optimizes a minimax objective that aims to construct the highest fidelity explanation with respect to the worst-case over a set of adversarial perturbations. We instantiate this algorithm for explanations in the form of linear models and decision sets by devising the required optimization procedures. To the best of our knowledge, this work makes the first attempt at generating post hoc explanations that are robust to a general class of adversarial perturbations that are of practical interest. Experimental evaluation with real-world and synthetic datasets demonstrates that our approach substantially improves robustness of explanations without sacrificing their fidelity on the original data distribution.

研究の動機と目的

  • ブラックボックスモデルの既存の後向き解釈手法における強靱性と安定性の欠如に対処すること。
  • 解釈が分布シフトや小さな入力摂動に対しても忠実なままであることを保証するフレームワークの開発。
  • 医療や刑事司法などハイリスク分野における解釈可能性を向上させることで、信頼性が高く、転送可能な解釈を生成すること。
  • 一般的な実用的分布シフト(例えば、周辺共変数の摂動を含む)に対する強靱性を形式化・実装すること。
  • 解釈の敵対的訓練が、分布シフト下での構造的安定性と忠実性を向上させることを示すこと。

提案手法

  • 定義された摂動集合内での最悪の分布シフトにおける解釈忠実性を最大化するミニマックス最適化目的関数を提案する。
  • 個々の共変数への摂動を含む、実用的な分布シフトのセットを定義し、解釈において周辺依存関係が保持されるようにする。
  • 線形モデル(ロジスティック回帰)と意思決定集合の2種類の解釈タイプに対応する、特別な最適化手順を設計し、勾配ベースの学習を可能にする。
  • 敵対的訓練を用いて、入力レベルの摂動(敵対的強靱性)と分布レベルのシフト(分布的強靱性)の両方に耐性を持つ解釈を生成する。
  • 重み付き忠実度目的関数を用いて、単一およびサブグループベースのブラックボックスモデル(例:複数のロジスティック回帰または意思決定集合)にフレームワークを適用する。
  • 連続的パラメータモデルには勾配降下法を、離散的構造(意思決定集合など)には特化した最適化を活用する。

実験結果

リサーチクエスチョン

  • RQ1元のデータ分布上での忠実度を損なわせることなく、分布シフトに対して後向き解釈を強靱化できるか?
  • RQ2解釈の敵対的訓練は、小さな入力摂動下での安定性をどのように向上させるか?
  • RQ3統一されたフレームワークは、線形モデルと意思決定集合の両方に対して強靱な解釈を生成できるか?
  • RQ4LIME、SHAP、MUSEと比較して、ROPEが生成する解釈は、分布シフトの下でもどの程度構造的類似性を保っているか?
  • RQ5周辺共変数の摂動に対する強靱性は、誤った相関関係の検出における解釈の信頼性を向上させるか?

主な発見

  • Bailデータセットで単一のロジスティック回帰ブラックボックスを解釈する際、ROPEロジスティックおよびROPEロジスティックマルチは、LIMEおよびSHAPと比較して係数不一致が38.2%低かった。
  • 複数のロジスティック回帰ブラックボックスにおいて、ROPEロジスティックマルチはベースラインと比較して、少なくとも38.05%の係数不一致低減を達成した。
  • Bailデータセットにおいて、単一または複数の意思決定集合を解釈する際、ROPEdsetマルチはMUSEと比較して、それぞれ42.3%および60.4%高いルール一致率を達成した。
  • ROPEdsetマルチは、ベースラインと比較して少なくとも37%高い特徴一致率を達成し、ブラックボックスとの構造的整合性が強いことを示した。
  • 入力摂動下での評価において、ROPEの解釈はベースラインと比較して18.21%から21.08%高い構造的類似性を示し、優れた安定性を確認した。
  • このフレームワークは、敵対的入力摂動および分布シフトの両方に対する強靱性を効果的に向上させたが、元のデータ分布上での忠実度に損なわれることなく、良好な性能を維持した。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。