Skip to main content
QUICK REVIEW

[논문 리뷰] Uncertainty Estimation and Out-of-Distribution Detection for Counterfactual Explanations: Pitfalls and Solutions

Eoin Delaney, Derek Greene|arXiv (Cornell University)|2021. 07. 20.
Explainable Artificial Intelligence (XAI)참고 문헌 42인용 수 12
한 줄 요약

이 논문은 몬테 카를로 드롭아웃과 트러스트 스코어를 사용하여 불확실성 추정 및 분포 외(counterfactual) 설명을 탐지하기 위한 실용적인 방법을 제안한다. 이러한 기법들이 고위험 영역의 인공지능 응용 프로그램에서 신뢰성을 향상시키며, 모호하거나 근거가 부족하거나 적대적인 반례를 식별함으로써 기여한다. 특히 프로토-CF는 외관적으로 타당해 보이지만 높은 불확실성과 낮은 신뢰도 스코어를 보인다.

ABSTRACT

Whilst an abundance of techniques have recently been proposed to generate counterfactual explanations for the predictions of opaque black-box systems, markedly less attention has been paid to exploring the uncertainty of these generated explanations. This becomes a critical issue in high-stakes scenarios, where uncertain and misleading explanations could have dire consequences (e.g., medical diagnosis and treatment planning). Moreover, it is often difficult to determine if the generated explanations are well grounded in the training data and sensitive to distributional shifts. This paper proposes several practical solutions that can be leveraged to solve these problems by establishing novel connections with other research works in explainability (e.g., trust scores) and uncertainty estimation (e.g., Monte Carlo Dropout). Two experiments demonstrate the utility of our proposed solutions.

연구 동기 및 목표

  • 의료와 같은 고위험 분야에서의 잘못된 조치나 해로운 결과를 초래할 수 있는 반례 설명의 불확실성 추정 부족 문제를 해결하기 위해.
  • 학습 데이터에 기반하지 않은 분포 외 반례를 식별하고 위험을 완화하기 위해.
  • 불확실성 및 신뢰도 지표를 사용하여 기존 반례 생성 방법의 분포 이탈에 대한 내성에 대한 평가를 수행하기 위해.
  • 모델 아키텍처에 종속되지 않는 실용적인 도구인 몬테 카를로 드롭아웃과 트러스트 스코어를 제안하여 설명의 불확실성과 데이터 분포 적합도를 평가하기 위해.
  • 실증적 평가를 통해 향후 더 신뢰할 수 있고 검증된 반례 설명 개발을 이끌기 위한 지침을 제공하기 위해.

제안 방법

  • 드롭아웃가능한 신경망을 통해 다수의 순방향 전파를 수행함으로써 에피스테믹 불확실성을 추정하기 위해 몬테 카를로 드롭아웃을 사용한다.
  • 분포 외 탐지를 위한 프록시로 트러스트 스코어를 활용하며, 반례가 반례 클래스의 학습 데이터와 얼마나 유사한지를 측정한다.
  • 표본, 이미지, 시간 시리즈 데이터에서 최신의 세 가지 반례 기법(NUN-CF, W-CF, Proto-CF)에 대해 이러한 방법을 적용한다.
  • 모델에 종속되지 않는 평가를 통합함으로써 모델 아키텍처나 오토에코더의 가용성에 대한 가정을 피한다.
  • 트러스트 스코어의 효과성을 검증하기 위해 몬테 카를로 드롭아웃 불확실성과 실제 데이터 분포 적합도를 비교한다.
  • MC-Mean와 트러스트 스코어 평균 값을 정량적 지표로 사용하여 생성된 반례의 불확실성과 분포 타당성을 평가한다.

실험 결과

연구 질문

  • RQ1어떻게 하면 반례 설명의 불확실성을 신뢰성 있게 추정하여 과신된 또는 잠재적으로 해로운 권고를 방지할 수 있는가?
  • RQ2기존의 반례 생성 방법은 분포 이탈에 얼마나 견고한가? 그리고 분포 외 반례는 어떻게 탐지할 수 있는가?
  • RQ3트러스트 스코어는 훈련 데이터에 대한 반례 설명의 타당성과 근거의 정도를 평가하는 데 신뢰할 수 있는 모델에 종속되지 않는 프록시가 될 수 있는가?
  • RQ4다양한 데이터 유형에서 다른 반례 방법(NUN-CF, W-CF, Proto-CF) 간의 불확실성과 신뢰성에 대한 비교는 어떻게 이루어지는가?
  • RQ5고위험 영역에서 반례 설명의 실제 구현에 있어 높은 불확실성과 낮은 신뢰도 스코어가 가지는 실용적 함의는 무엇인가?

주요 결과

  • 이미지 영역에서 프로토-CF가 생성한 반례는 외관적으로 타당해 보이지만 높은 불확실성(MC-Mean ≈ 0.67)과 낮은 트러스트 스코어(평균 = 0.977 ± 0.008)를 보여, 훈련 데이터에 기반하지 않는 것으로 나타났다.
  • W-CF는 원래 잘못 분류된 인스턴스와 거의 동일한 트러스트 스코어를 보였으며, 이는 반례가 적대적 예제와 의미적으로 다를 바 없고, 작은 픽셀 변형으로 인해 거의 인식되지 않는다는 것을 시사한다.
  • NUN-CF는 상당히 낮은 불확실성(MC-Mean ≈ 0.93)과 높은 트러스트 스코어를 보였으며, 이는 훈련 데이터와 강한 일치를 보임을 의미한다. 다만 복잡한 상황에서는 희소성이나 근접성 측면에서 부족할 수 있다.
  • 트러스트 스코어는 분포 적합도를 효과적으로 반영하였으며, 분포 외 반례를 식별하는 데 원시 소프트맥스 확률보다 더 강력한 프록시로 기능하였다.
  • 연구 결과, 외관적으로 타당해 보이는 반례(예: 흐릿하거나 약간의 왜곡이 있는 이미지)도 높은 불확실성과 낮은 신뢰도를 보일 수 있음을 확인하였으며, 이는 공식적인 불확실성 추정의 필요성을 강조한다.
  • 결과적으로, 특히 모델 신뢰도와 안전성이 핵심적인 의료 분야와 같이 고위험 영역에서는 불확실성 인식 평가의 중요성이 매우 높다는 점이 부각된다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.