Skip to main content
QUICK REVIEW

[논문 리뷰] How Much Can I Trust You? -- Quantifying Uncertainties in Explaining Neural Networks

Kirill Bykov, Marina Höhne|arXiv (Cornell University)|2020. 06. 16.
Explainable Artificial Intelligence (XAI)참고 문헌 37인용 수 18
한 줄 요약

이 논문은 기존의 설명 방법(예: LRP)을 베이지안 신경망(BNNs)에 적응시켜 신경망 해석의 불확실성을 정량화하는 새로운 프레임워크 B-LRP를 제안한다. BNN의 사후분포에서 샘플링을 통해 B-LRP는 설명의 분포를 생성하며, 백분위수 기반 신뢰 수준(예: 보수적인 해석을 위한 5번째 백분위수)을 제공한다. 이는 시각화 지ap(열화상도)에서의 허위 관련성의 심각한 감소와 안전 중심 응용 분야에서의 신뢰성 향상에 기여한다.

ABSTRACT

Explainable AI (XAI) aims to provide interpretations for predictions made by learning machines, such as deep neural networks, in order to make the machines more transparent for the user and furthermore trustworthy also for applications in e.g. safety-critical areas. So far, however, no methods for quantifying uncertainties of explanations have been conceived, which is problematic in domains where a high confidence in explanations is a prerequisite. We therefore contribute by proposing a new framework that allows to convert any arbitrary explanation method for neural networks into an explanation method for Bayesian neural networks, with an in-built modeling of uncertainties. Within the Bayesian framework a network's weights follow a distribution that extends standard single explanation scores and heatmaps to distributions thereof, in this manner translating the intrinsic network model uncertainties into a quantification of explanation uncertainties. This allows us for the first time to carve out uncertainties associated with a model explanation and subsequently gauge the appropriate level of explanation confidence for a user (using percentiles). We demonstrate the effectiveness and usefulness of our approach extensively in various experiments, both qualitatively and quantitatively.

연구 동기 및 목표

  • 기존의 깊이 신경망 설명 방법에서의 불확실성 정량화 부족 문제를 해결하기 위해.
  • 특히 안전 중심 도메인에서 신뢰 기반 설명을 가능하게 하기 위해 설명의 불확실성을 모델링하기 위해.
  • 기존의 어떤 설명 방법(예: LRP)이라도 베이지안 신경망과 함께 작동하도록 확장하여 확률적 설명 출력을 생성하기 위해.
  • 사용자가 설명의 신뢰도를 조절할 수 있는 조절 가능한 신뢰 수준(백분위수 기반, 예: 고경계 결정을 위한 5번째 백분위수)을 제공하기 위해.
  • 실증적으로 불확실성 인식 해석이 시각화 지점에서의 잘못된 양성 결과를 감소시키고, 정밀도와 신뢰도를 향상시킴을 검증하기 위해.

제안 방법

  • BNN의 사후분포에서의 지식 전이를 통해 BNN의 불확실성을 기존의 어떤 설명 방법에도 적용한다.
  • 입력마다 몬테카를로 드롭아웃 또는 사후분포 샘플링을 사용해 다수의 순방향 전파를 수행하여 설명 점수(예: 관련성 맵)의 분포를 생성한다.
  • 결과로 생성된 설명 분포를 기반으로 백분위수(예: 5번째, 50번째, 95번째)를 계산하여 위험 조정 기반 설명을 가능하게 하며, 낮은 백분위수는 더 보수적이고 신뢰할 수 있는 영역을 제공한다.
  • 이 프레임워크는 LRP에 적용되어 B-LRP를 생성하며, 단일 히트맵 대신 관련성 맵의 분포를 출력한다.
  • 불확실성은 공간적으로 시각화되어 높은 신뢰도 영역(빨간색)과 낮은 신뢰도 영역(파란색)을 강조하며, 예를 들어 가스 램프와 같은 관련 없는 물체에 대한 허위 관련성을 제거한다.
  • 이 방법은 모델 무관 또는 모델 의존 설명 방법과 어떤 근사 추론 기법을 사용하는 BNN과도 일반적으로 호환 가능하다.

실험 결과

연구 질문

  • RQ1현재 결정론적이고 오해의 소지가 있는 해석으로 간주되는 신경망 해석에서 불확실성을 정량화할 수 있는가?
  • RQ2기존의 설명 방법(예: LRP)을 어떻게 베이지안 신경망을 사용해 불확실성 인식 출력으로 변환할 수 있는가?
  • RQ3백분위수 기반의 설명 임계치(예: 5번째 백분위수)가 시각화 지점에서의 허위 관련성을 걸러내어 신뢰도를 얼마나 향상시킬 수 있는가?
  • RQ4불확실성 인식 해석이 픽셀 뒤집기 또는 기능 중요도 순서 매기기와 같은 표준 평가 벤치마크에서 성능 향상에 기여하는가?
  • RQ5제안된 방법이 '현명한 한스 효과'를 줄일 수 있는가? 즉, 훈련 데이터에 존재하는 허위 특징(예: 가스 램프)에 의존하는 모델이 아닌, 가장 확신 있는 특징만 강조하는가?

주요 결과

  • MNIST에서의 픽셀 뒤집기 평가에서 5번째 백분위수 B-LRP는 표준 LRP보다 우수했으며, x ≤ 12인 경우 x%의 가장 중요한 픽셀을 정확히 식별했다.
  • ImageNet에서는 5번째 백분위수 B-LRP가 표준 LRP와 달리 성벽에만 관련성을 할당하며, 가스 램프에 대한 허위 관련성을 제거했다.
  • 고신뢰도(5번째 백분위수) 해석은 시각적으로나 정량적으로 더 정확했으며, 허위 관련성 감소와 정밀도 향상을 확인했다.
  • B-LRP는 표준 LRP가 훈련 데이터에 존재하는 가스 램프와 같은 예술적 특징에 잘못된 관련성을 할당하는 것을 보여줌으로써 '현명한 한스 효과'를 성공적으로 드러냈다.
  • 100개의 사후 샘플을 사용하면 굵은 백분위수 분석에 대해 안정적인 불확실성 추정이 가능했지만, 더 정밀한 백분위수(예: 1번째)는 더 많은 샘플이 필요하다.
  • 이 방법은 일반적이며, 어떤 설명 방법과 BNN 추론 기법에도 적용 가능하여 다양한 응용 분야에서 위험 조정 기반의 설명 가능성을 제공한다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.