Skip to main content
QUICK REVIEW

[論文レビュー] Learning Global Transparent Models Consistent with Local Contrastive Explanations

Tejaswini Pedapati, Avinash Balakrishnan|arXiv (Cornell University)|Feb 19, 2020
Explainable Artificial Intelligence (XAI)参考文献 26被引用数 8
ひとこと要約

本稿では、ブラックボックスモデルからの局所的対照的解釈に整合するが、グローバルに解釈可能で透明性のあるモデル(例:決定木、ルールリスト)を訓練する手法を提案する。スパースな局所的対照的解釈を、独自の離散化スキームを用いてカスタムブール値特徴に変換することで、従来手法に比べて顕著に高い局所的整合性を達成しながら、競争力ある性能を維持する。

ABSTRACT

There is a rich and growing literature on producing local contrastive/counterfactual explanations for black-box models (e.g. neural networks). In these methods, for an input, an explanation is in the form of a contrast point differing in very few features from the original input and lying in a different class. Other works try to build globally interpretable models like decision trees and rule lists based on the data using actual labels or based on the black-box models predictions. Although these interpretable global models can be useful, they may not be consistent with local explanations from a specific black-box of choice. In this work, we explore the question: Can we produce a transparent global model that is simultaneously accurate and consistent with the local (contrastive) explanations of the black-box model? We introduce a natural local consistency metric that quantifies if the local explanations and predictions of the black-box model are also consistent with the proxy global transparent model. Based on a key insight we propose a novel method where we create custom boolean features from sparse local contrastive explanations of the black-box model and then train a globally transparent model on just these, and showcase empirically that such models have higher local consistency compared with other known strategies, while still being close in performance to models that are trained with access to the original data.

研究の動機と目的

  • グローバルに解釈可能なモデルとブラックボックスモデルからの局所的対照的解釈の間のギャップを埋めること。
  • 選択されたブラックボックスモデルの局所的挙動を再現するグローバルな透明モデルを保証する手法を開発すること。
  • 局所的解釈とグローバルモデルの予測の整合性を定量化する整合性指標を定義すること。
  • 元の学習データに依存せずに、局所的対照的解釈のみを用いてグローバルモデルを訓練すること。
  • モデルの精度を損なわせることなく、局所的整合性を向上させること。

提案手法

  • グローバルモデルが与えられた入力についてブラックボックスモデルの予測と局所的対照的解釈(PPおよびPN)に合意するかどうかを評価する、局所的整合性指標を提案する。
  • スパースな局所的対照的解釈(関連する正例および負例)を、カスタムの離散化およびビニングスキームを用いてブール値節に変換する。
  • 局所的忠実性を確保するため、PPおよびPNの特徴の上限および下限を定義し、丸め処理とグリッドベースの離散化を用いる。
  • 局所的解釈から導出されたこれらのブール値節から構成される新しいデータセットを構築し、この合成データセット上で透明なグローバルモデル(例:決定木)を訓練する。
  • 鍵となる洞察:局所的対照的解釈は自然にスパースで意味のある特徴相互作用を含んでおり、これを直接論理積としてエンコードできる。
  • ブラックボックスモデルの局所的挙動に忠実で、かつ精度の高いグローバルモデルを訓練するための手法を適用する。

実験結果

リサーチクエスチョン

  • RQ1グローバルな透明モデルとブラックボックスモデルの局所的対照的解釈との間の整合性をどのように測定できるか?
  • RQ2局所的解釈のみを用いて、精度とブラックボックスモデルの局所的挙動に忠実なグローバルに解釈可能なモデルを訓練できるか?
  • RQ3局所的対照的解釈から得たカスタムブール値特徴を用いることで、モデルの整合性と性能にどのような影響を与えるか?
  • RQ4提案手法は、従来のアプローチと比較して、局所的整合性と精度の面でどのように異なるか?
  • RQ5異なるデータセットやブラックボックスモデルに対して、本手法は一般化可能であり、局所的忠実性を保持できるか?

主な発見

  • 提案手法は、元のデータや標準的な特徴工学を用いるベースライン手法と比較して、ブラックボックスモデルの解釈に顕著に高い局所的整合性を達成する。
  • 局所的対照的解釈から得たカスタムブール値特徴を用いて訓練されたグローバルモデルは、元のデータを用いて訓練されたモデルよりも局所的整合性が優れており、精度は同等を維持する。
  • 本手法は、局所的解釈から得たスパースで意味のある特徴相互作用を効果的に捉え、それがグローバルモデル構造に保存されることを示している。
  • MagicおよびWisconsin乳癌データセットにおける実験結果から、グローバルモデルの上位ランクのブール値特徴が、局所的対照的解釈と密接に一致することが明らかになった。
  • 本手法により、局所的忠実性とグローバルな解釈可能性の両方を満たす透明なモデルの構築が可能となり、モデル解釈性における主要な制限を克服できる。
  • 本手法は、さまざまなブラックボックスモデルやデータセットに対してロバストであり、元の学習データにアクセスせずに高い整合性を維持する。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。