Skip to main content
QUICK REVIEW

[논문 리뷰] It's better to say "I can't answer" than answering incorrectly: Towards Safety critical NLP systems

Neeraj Varshney, Swaroop Mishra|arXiv (Cornell University)|2020. 08. 21.
Topic Modeling참고 문헌 25인용 수 5
한 줄 요약

이 논문은 모델의 정확성에 대한 확률을 예측하는 캘리브레이션 방법을 제안하며, 정확성을 이진 레이블로 간주하는 것과는 달리, 안전이 중요한 자연어 처리(NLP) 시스템의 신뢰성을 향상시킨다. MNLI 및 OOD 기준에서 AUC가 최대 10.22% 향상되었고, 도메인 내 정확도 99%를 유지하면서 OOD 예측에 대해 2.6% 더 많은 기각(abstention)을 가능하게 했다.

ABSTRACT

In order to make AI systems more reliable and their adoption in safety critical applications possible, it is essential to impart the capability to abstain from when their prediction is likely to be incorrect and seek human intervention. Recently proposed selective answering techniques model calibration as a binary classification task. We argue that, not all incorrectly answered questions are incorrect to the same extent and the same is true for correctly answered questions. Hence, treating all correct predictions equally and all incorrect predictions equally constraints calibration. In this work, we propose a methodology that incorporates the degree of correctness, shifting away from classification labels as it directly tries to predict the probability of model's prediction being correct. We show the efficacy of the proposed method on existing Natural Language Inference (NLI) datasets by training on SNLI and evaluating on MNLI mismatched and matched datasets. Our approach improves area under the curve (AUC) of risk-coverage plot by 10.22\% and 8.06\% over maxProb with respect to the maximum possible improvement on MNLI mismatched and matched set respectively. In order to evaluate our method on Out of Distribution (OOD) datasets, we propose a novel setup involving questions with a variety of reasoning skills. Our setup includes a test set for each of the five reasoning skills: numerical, logical, qualitative, abductive and commonsense. We select confidence threshold for each of the approaches where the in-domain accuracy (SNLI) is 99\%. Our results show that, the proposed method outperforms existing approaches by abstaining on 2.6\% more OOD questions at respective confidence thresholds.

연구 동기 및 목표

  • 예측이 잘못될 가능성이 높을 때 모델이 기각할 수 있도록 해, 안전이 중요한 응용 분야에서 NLP 시스템의 신뢰성을 향상시키기 위해.
  • 기존의 선택적 답변 방법이 모든 정확한 및 잘못된 예측을 동일하게 취급하는 한계를 해결하기 위해.
  • 캘리브레이션을 위해 정확성의 정도를 이진 분류가 아닌 연속 확률로 모델링하기 위해.
  • 외부 분포(out-of-distribution, OOD) 환경에서 다양한 추론 기술에 대해 성능을 평가하기 위해.
  • 개선된 신뢰도 캘리브레이션을 통해 정확한 예측의 커버리지(범위)를 높이면서도 잘못된 예측을 최소화하기 위해.

제안 방법

  • 정확성의 이진 분류에서 벗어나, 모델 예측이 정확할 가능성의 확률을 예측하는 방식으로 전환한다.
  • 예측 품질의 미묘한 차이를 반영하기 위해, 정확성의 가능성 추정을 위한 회귀 기반 접근법을 사용한다.
  • SNLI에서 학습하고, MNLI의 매치드 및 매치드 아님 셋에서 평가하여 캘리브레이션 성능을 분석한다.
  • 수치적, 논리적, 정성적, 추론적, 일반 지식 기반 추론의 다섯 가지 추론 기술 유형을 포함한 새로운 OOD 평가 설정을 도입한다.
  • SNLI에서 도메인 내 정확도 99%를 유지할 수 있도록 신뢰도 임계값을 설정하여, 다양한 방법 간의 공정한 비교를 가능하게 한다.
  • 기각과 정확성 간의 트레이드오프를 평가하기 위해 리스크-커버리지 플롯을 사용한다.

실험 결과

연구 질문

  • RQ1정확성의 정도를 모델링하는 것이 이진 분류를 초월해 NLP에서 캘리브레이션을 향상시킬 수 있는가?
  • RQ2제안된 방법은 다양한 추론 기술을 가진 외부 분포 예측에서 어떻게 성능을 발휘하는가?
  • RQ3기존의 maxProb 기준 대비 리스크-커버리지 플롯에서 더 높은 AUC를 달성할 수 있는가?
  • RQ4도메인 외부 데이터에서 기각 비율을 얼마나 높일 수 있으며, 동시에 도메인 내 정확도를 유지할 수 있는가?
  • RQ5이 방법은 외부 분포 환경에서 다양한 추론 유형에 대해 일반화 가능한가?

주요 결과

  • 제안된 방법은 MNLI 매치드 아님 셋에서 maxProb 대비 리스크-커버리지 플롯의 AUC를 10.22% 향상시켰다.
  • 매치드 셋에서는 가능한 최대 향상률 대비 8.06% 향상되었으며, 이는 상대적 향상률을 의미한다.
  • 기존 방법 대비 도메인 외부 예측에서 2.6% 더 많은 기각이 가능했고, 이는 도메인 내 정확도 99% 기준이다.
  • 이 방법은 OOD 평가 설정의 다섯 가지 추론 기술 유형 전반에서 일관된 성능 향상을 보였다.
  • 정확성을 연속적인 확률로 모델링할 경우, NLP 시스템의 캘리브레이션과 안전성이 향상됨을 확인하였다.
  • 이 방법은 도메인 내 및 도메인 외부 환경 모두에서 maxProb를 능가하며, 더 넓은 범위의 신뢰성 확보를 의미한다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.