Skip to main content
QUICK REVIEW

[논문 리뷰] Explaining Predictive Uncertainty by Looking Back at Model Explanations

Hanjie Chen, Du, Wanyu|arXiv (Cornell University)|2022. 01. 11.
Topic Modeling인용 수 4
한 줄 요약

이 논문은 사전에 훈련된 언어 모델의 예측 불확실성에 대해 '불확실한 단어'—예측 신뢰도에 부정적 영향을 미치지만 기존 설명 방법에서 간과되는 단어—를 규명하여 설명하는 방법을 제안한다. 기존 모델 설명(예: Leave-one-out 또는 Sampling Shapley를 통해)에서 이러한 단어를 추출함으로써 예측이 왜 불확실한지 밝혀내며, 실험과 인간 평가를 통해 불확실성 설명이 종합적인 모델 해석 가능성과 사용자 신뢰를 확보하는 데 필수적임을 입증한다.

ABSTRACT

Predictive uncertainty estimation of pre-trained language models is an important measure of how likely people can trust their predictions. However, little is known about what makes a model prediction uncertain. Explaining predictive uncertainty is an important complement to explaining prediction labels in helping users understand model decision making and gaining their trust on model predictions, while has been largely ignored in prior works. In this work, we propose to explain the predictive uncertainty of pre-trained language models by extracting uncertain words from existing model explanations. We find the uncertain words are those identified as making negative contributions to prediction labels, while actually explaining the predictive uncertainty. Experiments show that uncertainty explanations are indispensable to explaining models and helping humans understand model prediction behavior.

연구 동기 및 목표

  • 사용자 신뢰에 중요시되지만 사전에 훈련된 언어 모델의 예측 불확실성에 대한 설명이 부족한 문제를 해결하기 위해.
  • 예측 신뢰도에 악영향을 미치는 단어가 불확실성의 원인으로 식별될 수 있는지 조사하기 위해.
  • 라벨 설명 외에도 불확실성 설명이 모델 행동을 이해하는 데 필수적임을 입증하기 위해.
  • 인간 평가와 모델 성능 지표를 통해 불확실성 설명의 효과성을 평가하기 위해.
  • 라벨과 관련된(중요한) 단어와 불확실성과 관련된(불확실한) 단어를 모두 포함하는 통합 설명 프레임워크를 제안하기 위해.

제안 방법

  • Leave-one-out(LOO) 및 Sampling Shapley(SS) 두 가지 방법을 사용해 주목할 만한 토큰을 식별하기 위해 모델 설명을 추출한다.
  • 예측 레이블에 대한 기여가 부정적이지만 예측 신뢰도를 낮추는 데 높은 영향을 미치는 단어를 '불확실한 단어'로 식별한다.
  • 지역 모델 해석 가능성(LMI) 점수를 통해 불확실성 설명을 정의하며, LMI 값이 높게 음수인 토큰은 불확실한 것으로 표시한다.
  • 토큰 간의 LMI 점수를 정규화하여 분포를 형성하고, 신뢰도에 대한 부정적 기여도가 높은 상위 순위의 불확실한 단어를 선별한다.
  • 불확실한 단어를 제거했을 때의 신뢰도 변화(예: 69%에서 93%로)를 불확실성 설명 품질의 대체 지표로 사용한다.
  • Amazon Mechanical Turk를 통해 중요 단어와 불확실한 단어에 대한 인간 평가를 실시하며, 예측 정확도, 설명 품질, 비교적 유용성 등을 평가한다.

실험 결과

연구 질문

  • RQ1기존 모델 설명에서 유의미하게 추출된 '불확실한 단어'(예측 신뢰도를 낮추는 단어)를 신뢰성 있게 식별할 수 있는가?
  • RQ2LOO와 Sampling Shapley 방법이 예측 불확실성을 설명하는 데 유의미한 불확실한 단어를 식별하는 데 얼마나 효과적인가?
  • RQ3라벨 설명 외에 불확실성 설명이 사용자에게 모델 예측을 이해하는 데 얼마나 기여하는가?
  • RQ4불확실한 단어를 제거하면 모델의 신뢰도가 유의미하게 증가하는가? 이는 그들이 불확실성의 핵심 역할을 한다는 것을 검증하는가?
  • RQ5사용자가 모델 행동을 이해하는 데 도움이 되는지 평가했을 때, 불확실성 설명이 라벨 설명보다 더 유용하게 인식되는가?

주요 결과

  • 예측 레이블에 대한 기여가 부정적인 것으로 식별된 불확실한 단어는 모델의 신뢰도를 크게 낮추며, 이는 예측 불확실성을 설명하는 데 핵심적인 역할을 한다.
  • 실험 결과, 한 예시에서 불확실한 단어를 제거함으로써 예측 신뢰도가 69%에서 93%로 상승함으로써 그들이 불확실성에 기여한다는 것이 검증되었다.
  • 인간 평가 결과, 불확실성 설명이 필수적임이 확인되었으며, 85%의 평가자가 불확실한 단어를 제거했을 때의 신뢰도 변화를 정확히 예측했다.
  • 평균적으로 불확실성 설명은 명확성과 유용성 측면에서 4.2/5의 평점을 받았으며, 비교 평가에서 라벨 설명보다 뛰어난 성능을 보였다.
  • LMI 기반 방법은 효과적으로 불확실한 단어를 식별하며, LMI 분포 상 상위 10개 토큰이 일관되게 신뢰도에 부정적 영향을 미침을 보였다.
  • LOO와 Sampling Shapley 방법 모두 의미 있는 불확실성 설명을 성공적으로 추출하였으며, SS 방법이 데이터셋 간 일관성에서 略로 더 우수한 성능을 보였다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.