Skip to main content
QUICK REVIEW

[논문 리뷰] Causal Interpretability for Machine Learning -- Problems, Methods and Evaluation

Raha Moraffah, Mansooreh Karami|arXiv (Cornell University)|2020. 03. 09.
Explainable Artificial Intelligence (XAI)참고 문헌 99인용 수 13
한 줄 요약

이 논문은 인과적 해석 가능성(cause interpretability)을 기계학습의 프레임워크로 도입하여, 대체 가능성을 고려한 인과적 추론을 통해 모델 결정에 대한 '왜'와 '만약 그렇다면' 질문에 답할 수 있도록 한다. 이는 대체 가능성을 기반으로 한 추론과 인과적 추론을 활용한다. 이 논문은 대체 가능 예시, 모델 기반 분석, 공정성 평가, 인과관계 검증을 포함한 인과적 해석 가능성 방법의 분류 체계를 제안하고, 정밀도, 다양성, 충실도, 인과적 공정성 등의 지표를 포함하는 종합적인 평가 프레임워크를 제공한다.

ABSTRACT

Machine learning models have had discernible achievements in a myriad of applications. However, most of these models are black-boxes, and it is obscure how the decisions are made by them. This makes the models unreliable and untrustworthy. To provide insights into the decision making processes of these models, a variety of traditional interpretable models have been proposed. Moreover, to generate more human-friendly explanations, recent work on interpretability tries to answer questions related to causality such as "Why does this model makes such decisions?" or "Was it a specific feature that caused the decision made by the model?". In this work, models that aim to answer causal questions are referred to as causal interpretable models. The existing surveys have covered concepts and methodologies of traditional interpretability. In this work, we present a comprehensive survey on causal interpretable models from the aspects of the problems and methods. In addition, this survey provides in-depth insights into the existing evaluation metrics for measuring interpretability, which can help practitioners understand for what scenarios each evaluation metric is suitable.

연구 동기 및 목표

  • 관측된 상관관계만을 통해 결정을 설명하는 전통적인 해석 가능성 모델의 한계를 해결하기 위해.
  • 특정 특성 또는 모델 구성 요소에 대한 가정적 변화에 대해 '만약 그렇다면' 질문에 답할 수 있는 새로운 패러다임으로 인과적 해석 가능성 도입.
  • 대체 가능 예시 생성, 모델 구성 요소 분석, 공정성 평가, 인과관계 검증을 포함한 인과적 해석 가능성 방법의 체계적 분류 제공.
  • 정밀도, 다양성, 충실도, 인과적 공정성 등의 다양한 특성에 맞는 지표를 사용하여 인과적 해석 가능성 방법 평가.
  • 특정 사용 사례와 가정적 시나리오 하에서의 모델 행동에 따라 적절한 평가 지표 선택을 안내하기 위해.

제안 방법

  • 인과적 해석 가능성을 네 가지 유형으로 분류: 대체 가능 예시, 모델 기반 해석 가능성, 인과적 공정성 모델, 인과관계 검증.
  • 인과적 추론에서 유래한 대체 가능 분석을 활용해, 모델 예측을 변화시킬 수 있는 가정적 입력을 생성함으로써 '만약 그렇다면' 추론을 가능하게 함.
  • 정밀도와 다양성을 측정하기 위해 거리 지표(예: L2, 해밍 거리)를 사용하며, 다양성은 생성된 대체 가능 예시 간 평균 쌍별 거리로 계산함.
  • 기울기 기반 최적화를 활용해 대체 가능 예시를 효율적으로 생성하며, 시간과 기울기 업데이트 횟수로 속도 측정.
  • 시각-언어적 대체 가능 예시를 위한 지표 도입: IoU 기반 정확도 및 시각적 영역과 언어적 설명 간 일致성.
  • 인과 효과 추정(예: 평균 인과 효과)을 적용해 모델 구성 요소의 중요도를 평가하고, 할당 맵의 타당성을 검증함.

실험 결과

연구 질문

  • RQ1기계학습 모델은 어떻게 상관관계를 넘어서 '만약 그렇다면' 시나리오에 답할 수 있는가?
  • RQ2인과적 해석 가능성의 핵심 방법론적 범주들은 무엇이며, 기존의 해석 가능성 모델과 어떻게 다를까?
  • RQ3정밀도, 다양성, 충실도 측면에서 대체 가능 설명의 품질을 평가하는 데 가장 적합한 평가 지표는 무엇인가?
  • RQ4인과적 해석 가능성은 어떻게 모델 결정에서의 편향과 차별을 탐지하고 설명하는 데 응용될 수 있는가?
  • RQ5모델 기반 인과적 해석 가능성과 인과적 공정성 평가의 과제는 무엇이며, 어떻게 해결할 수 있는가?

주요 결과

  • 인과적 해석 가능성은 입력 특성 또는 모델 구성 요소를 변경한 대체 가능 예시를 생성함으로써 모델이 '왜'와 '만약 그렇다면' 질문에 답할 수 있도록 한다.
  • 대체 가능 예시 생성 방법은 높은 정밀도와 다양성을 달성하며, 다양성은 생성된 대체 가능 예시 간 평균 쌍별 거리로 측정된다.
  • 시각-언어적 대체 가능 예시의 일치성을 검증하기 위해 IoU 및 정확도 지표가 사용된다.
  • 모델 기반 인과적 해석 가능성은 인과 효과 추정(예: ACE)을 통해 영향력 있는 구성 요소를 식별하며, 샐런시 맵을 통해 국소적 결정 규칙을 시각화한다.
  • 인과적 공정성 평가에서는 직접적, 간접적, 허위 효과 분해를 활용해 편향을 탐지하지만, 아직 표준화된 정량적 지표는 존재하지 않는다.
  • 이 조사에서는 평가의 심각한 격차를 밝혀내며, 인과적 공정성에 대한 통합적이고 기초가 되는 지표가 아직 존재하지 않음을 강조하며, 이 분야의 열린 과제로 지적한다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.