Skip to main content
QUICK REVIEW

[논문 리뷰] Learning Global Transparent Models Consistent with Local Contrastive Explanations

Tejaswini Pedapati, Avinash Balakrishnan|arXiv (Cornell University)|2020. 02. 19.
Explainable Artificial Intelligence (XAI)참고 문헌 26인용 수 8
한 줄 요약

이 논문은 전역적으로 해석 가능한 투명한 모델(예: 의사결정트리, 규칙목록)을 훈련시키는 방법을 제안한다. 이 모델은 정확하고 대조적 해석에 국한된 블랙박스 모델과도 지역적으로 일致한다. 희박한 지역 대조적 해석을 새로운 이산화 기법을 통해 맞춤형 부울 특징으로 변환함으로써, 기존 방법보다 유의미하게 높은 지역 일치도를 달성하면서도 경쟁 가능한 성능을 유지한다.

ABSTRACT

There is a rich and growing literature on producing local contrastive/counterfactual explanations for black-box models (e.g. neural networks). In these methods, for an input, an explanation is in the form of a contrast point differing in very few features from the original input and lying in a different class. Other works try to build globally interpretable models like decision trees and rule lists based on the data using actual labels or based on the black-box models predictions. Although these interpretable global models can be useful, they may not be consistent with local explanations from a specific black-box of choice. In this work, we explore the question: Can we produce a transparent global model that is simultaneously accurate and consistent with the local (contrastive) explanations of the black-box model? We introduce a natural local consistency metric that quantifies if the local explanations and predictions of the black-box model are also consistent with the proxy global transparent model. Based on a key insight we propose a novel method where we create custom boolean features from sparse local contrastive explanations of the black-box model and then train a globally transparent model on just these, and showcase empirically that such models have higher local consistency compared with other known strategies, while still being close in performance to models that are trained with access to the original data.

연구 동기 및 목표

  • 전역적으로 해석 가능한 모델과 블랙박스 모델의 지역 대조적 해석 사이의 격차를 해소하기 위해.
  • 선택된 블랙박스 모델의 지역적 행동을 재현하는 전역 투명한 모델을 보장하는 방법을 개발하기 위해.
  • 지역 해석과 전역 모델 예측 간의 일치도를 수량화하는 일致성 지표를 정의하기 위해.
  • 원본 훈련 데이터에 의존하지 않고 오직 지역 대조적 해석만을 사용해 전역 모델을 훈련하기 위해.
  • 모델 정확도를 희생시키지 않고 지역 일치도를 향상시키기 위해.

제안 방법

  • 지정된 입력에서 전역 모델이 블랙박스 모델의 예측과 지역 대조적 해석(PPs 및 PNs)에 동의하는지 평가하는 지역 일치도 지표를 제안한다.
  • 희박한 지역 대조적 해석(유의미한 양성 및 음성)을 맞춤형 이산화 및 그룹화 기법을 사용해 부울 문장으로 변환한다.
  • 지역 충실도를 확보하기 위해 PPs 및 PNs의 특징 범위(상한 및 하한)를 정의하며, 반올림 및 격자 기반 이산화를 활용한다.
  • 지역 해석에서 파생된 이러한 부울 문장들로 구성된 새로운 데이터셋을 구성한 후, 이 합성 데이터셋을 기반으로 투명한 전역 모델(예: 의사결정트리)을 훈련시킨다.
  • 핵심 통찰: 지역 대조적 해석은 자연스럽게 희박하고 의미 있는 특징 상호작용을 포함하며, 이를 직접 논리적 논리곱으로 표현할 수 있다.
  • 이 방법을 적용해 정확하고 블랙박스 모델의 지역적 행동에 충실한 전역 모델을 훈련시킨다.

실험 결과

연구 질문

  • RQ1전역 투명한 모델과 블랙박스 모델의 지역 대조적 해석 간의 일치도를 어떻게 측정할 수 있는가?
  • RQ2오직 지역 해석만을 사용해 정확하고 블랙박스 모델의 지역적 행동에 충실한 전역 해석 가능한 모델을 훈련시킬 수 있는가?
  • RQ3지역 대조적 해석에서 파생된 맞춤형 부울 특징의 사용이 모델의 일치도와 성능에 어떤 영향을 미치는가?
  • RQ4기존 방법과 비교해 본다면, 제안된 방법은 지역 일치도와 정확도 측면에서 어떻게 다른가?
  • RQ5다양한 데이터셋과 블랙박스 모델에 대해 일반화 가능한가? 이때 지역 충실도가 유지되는가?

주요 결과

  • 제안된 방법은 원본 데이터 또는 표준 특징 공학을 사용하는 기준선 방법보다 블랙박스 모델 해석과 유의미하게 더 높은 지역 일치도를 달성한다.
  • 지역 대조적 해석에서 파생된 맞춤형 부울 특징을 기반으로 훈련된 전역 모델은 원본 데이터 기반 모델보다 지역 일치도에서 뛰어나며, 정확도는 유사하게 유지된다.
  • 이 방법은 지역 해석에서 유도된 희박하고 의미 있는 특징 상호작용을 성공적으로 포착하여 전역 모델 구조에 그대로 유지한다.
  • Magic 및 위스콘신 유방암 데이터셋에 대한 실험 결과, 전역 모델에서 상위 랭크된 부울 특징들이 지역 대조적 해석과 매우 밀접하게 일치함을 확인했다.
  • 이 방법은 지역 충실도와 전역 해석 가능성이라는 두 가지 핵심 요소를 동시에 확보한 투명한 모델을 구축할 수 있게 하여, 모델 해석 가능성 분야의 주요 한계를 해결한다.
  • 이 방법은 다양한 블랙박스 모델과 데이터셋에 대해 뛰어난 강건성을 보이며, 원본 훈련 데이터에 접근하지 않더라도 높은 일치도를 유지한다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.