Skip to main content
QUICK REVIEW

[논문 리뷰] A Causal Lens for Peeking into Black Box Predictive Models: Predictive Model Interpretation via Causal Attribution

Aria Khademi, Vasant Honavar|arXiv (Cornell University)|2020. 08. 01.
Explainable Artificial Intelligence (XAI)인용 수 4
한 줄 요약

이 논문은 Rubin-Neyman 잠재 결과 프레임워크를 사용하여 각 입력 특성의 모델 출력에 대한 인과적 영향을 추정함으로써 블랙박스 예측 모델을 해석하기 위한 인과적 기여도 프레임워크를 제안한다. 인과적 기여도가 상관관계 기반 방법보다 더 신뢰할 수 있고 신뢰도가 높은 설명을 제공함을 입증하며, 특히 혼동요인(confounders)이 존재할 경우 더욱 두드러진다. 이 방법은 숫자 인식 및 파킨슨병 예측을 포함한 합성 및 실세계 데이터셋에서 검증되었다.

ABSTRACT

With the increasing adoption of predictive models trained using machine learning across a wide range of high-stakes applications, e.g., health care, security, criminal justice, finance, and education, there is a growing need for effective techniques for explaining such models and their predictions. We aim to address this problem in settings where the predictive model is a black box; That is, we can only observe the response of the model to various inputs, but have no knowledge about the internal structure of the predictive model, its parameters, the objective function, and the algorithm used to optimize the model. We reduce the problem of interpreting a black box predictive model to that of estimating the causal effects of each of the model inputs on the model output, from observations of the model inputs and the corresponding outputs. We estimate the causal effects of model inputs on model output using variants of the Rubin Neyman potential outcomes framework for estimating causal effects from observational data. We show how the resulting causal attribution of responsibility for model output to the different model inputs can be used to interpret the predictive model and to explain its predictions. We present results of experiments that demonstrate the effectiveness of our approach to the interpretation of black box predictive models via causal attribution in the case of deep neural network models trained on one synthetic data set (where the input variables that impact the output variable are known by design) and two real-world data sets: Handwritten digit classification, and Parkinson's disease severity prediction. Because our approach does not require knowledge about the predictive model algorithm and is free of assumptions regarding the black box predictive model except that its input-output responses be observable, it can be applied, in principle, to any black box predictive model.

연구 동기 및 목표

  • 의료, 금융, 형사사법과 같은 고위험 도메인에서 신뢰할 수 있고 인과적인 블랙박스 예측 모델 설명의 필수적인 필요성을 해결하기 위해.
  • 혼동요인을 고려하지 못하고 신뢰할 수 없는 기여도를 초래하는 상관관계 기반 설명 방법의 한계를 극복하기 위해.
  • 모델의 내부 구조를 알지 못해도 관찰 가능한 입력-출력 행동만을 사용하여 블랙박스 모델을 해석할 수 있는 모델에 종속되지 않는 방법을 개발하기 위해.
  • 모델 해석을 인과성에 기반으로 하여 설명이 '왜'라는 질문에 신뢰와 책임감을 지원할 수 있도록 하기 위해.
  • 실세계 및 합성 환경에서 인과적 기여도의 효과성을 평가하여 기존의 특성 중요도 및 기울기 기반 방법보다 뛰어난 성능을 입증하기 위해.

제안 방법

  • 잠재 결과 프레임워크를 사용하여 입력을 '처리'(treatment)로, 모델 출력을 '결과'(outcome)로 간주함으로써 입력의 인과적 영향을 추정한다.
  • 블랙박스 모델의 입력-출력 반응에서 수집한 관찰 데이터를 활용하여 역확률가중법 및 성향스코어 매칭 등의 방법을 통해 평균 인과적 영향을 추정한다.
  • 강한 무시 가능성을 가정하며, 모든 혼동요인들이 관측되었고, 입력과 출력에 모두 영향을 주는 미관측 혼동요인이 존재하지 않는다는 조건을 필요로 한다.
  • 다양한 기법을 사용해 인과적 영향을 추정하고 일관성을 평가함으로써 일관성이 확보된 경우에만 신뢰할 수 있는 기여도를 우선시한다.
  • 이 프레임워크는 모델에 종속되지 않으며, 모델의 파라미터, 아키텍처, 학습 절차에 대한 정보가 필요하지 않다.
  • 구조적 인과 모델 또는 배경 지식을 활용하여 관찰 데이터에서 인과적 영향을 추정할 때 혼동요인을 식별하고 통제한다.

실험 결과

연구 질문

  • RQ1인과적 기여도는 상관관계 기반 방법보다 신뢰할 수 있고 더 안정적인 블랙박스 예측 모델 설명을 제공할 수 있는가?
  • RQ2모델 내부 정보에 접근할 수 없을 때, 입력-출력 관찰만으로 개별 특성의 모델 출력에 대한 인과적 영향을 어떻게 추정할 수 있는가?
  • RQ3혼동요인이 존재할 경우, 인과적 기여도는 기존의 특성 중요도나 기울기 기반 설명 방법보다 우월한가?
  • RQ4다양한 추정 기법 간에 인과적 기여도가 얼마나 일관되는가? 그리고 기법 간 일치는 설명에 대한 신뢰도를 향상시킬 수 있는가?
  • RQ5제안된 인과적 기여도 프레임워크는 실세계 및 합성 데이터셋, 특히 딥 네URAL 네트워크에 효과적으로 적용될 수 있는가?

주요 결과

  • 지식 기반의 진정한 인과 관계가 알려진 합성 데이터셋에서 인과적 기여도 프레임워크는 모델 출력을 담당하는 진정한 입력 특성을 성공적으로 식별한다.
  • 손글씨 숫자 분류 데이터셋에서, 이 방법은 이미지의 알려진 주요 특징과 일치하는 일관성 있고 해석 가능한 기여도를 제공한다.
  • 파킨슨병 중증도 예측의 경우, 이 접근법은 음성 및 운동 기능 지표와 같은 임상적으로 관련성이 있는 특징을 식별하여 실제 의료 응용 분야에서의 유용성을 입증한다.
  • 혼동요인이 존재할 경우, 인과적 기여도 방법은 더 정확하고 안정적인 기여도 추정을 통해 상관관계 기반 접근법보다 뛰어난 성능을 보였다.
  • 다양한 기법 간 인과적 영향 추정치의 불일치는 강한 무시 가능성 위반 가능성을 시사하며, 이는 설명을 신중히 다뤄야 할 경우를 나타낸다.
  • 입력-출력 행동이 관찰 가능한 한, 이 프레임워크는 어떤 블랙박스 모델에도 적용 가능하므로 기계학습 응용 분야 전반에 걸쳐 광범위하게 일반화 가능하다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.