Skip to main content
QUICK REVIEW

[논문 리뷰] Quantifying Uncertainty in Answers from any Language Model and Enhancing their Trustworthiness

Jiuhai Chen, Jonas Mueller|arXiv (Cornell University)|2023. 08. 30.
Topic Modeling인용 수 7
한 줄 요약

이 논문은 블랙박스 대규모 언어모델(LLM)의 출력에서 불확실성을 측정하기 위한 BSDetector를 소개한다. 이 방법은 동일한 LLM으로부터 다양한 온도 설정과 프롬프트 변형을 사용해 다수의 응답을 샘플링하고, 의미적 유사도와 온도 변화를 바탕으로 신뢰도 점수를 계산한다. 이를 통해 사용자는 신뢰할 수 없거나 환각된 답변을 식별하고, 재학습 없이도 가장 높은 신뢰도를 가진 응답을 선택하여 정확도를 향상시킬 수 있으며, 인간이 참여하는 환경과 완전히 자동화된 LLM 평가 환경 모두에서 신뢰성 향상에 기여한다.

ABSTRACT

We introduce BSDetector, a method for detecting bad and speculative answers from a pretrained Large Language Model by estimating a numeric confidence score for any output it generated. Our uncertainty quantification technique works for any LLM accessible only via a black-box API, whose training data remains unknown. By expending a bit of extra computation, users of any LLM API can now get the same response as they would ordinarily, as well as a confidence estimate that cautions when not to trust this response. Experiments on both closed and open-form Question-Answer benchmarks reveal that BSDetector more accurately identifies incorrect LLM responses than alternative uncertainty estimation procedures (for both GPT-3 and ChatGPT). By sampling multiple responses from the LLM and considering the one with the highest confidence score, we can additionally obtain more accurate responses from the same LLM, without any extra training steps. In applications involving automated evaluation with LLMs, accounting for our confidence scores leads to more reliable evaluation in both human-in-the-loop and fully-automated settings (across both GPT 3.5 and 4).

연구 동기 및 목표

  • 홀로지제이션 또는 과도하게 자신감 있는 응답으로 인해 고위험 응용 분야에서 LLM의 신뢰성이 떨어지는 문제를 해결하기 위해.
  • 학습 데이터에 접근할 수 없고 아키텍처 정보도 알 수 없는 블랙박스 API를 통해 접근 가능한 모든 LLM과 호환되는 불확실성 측정 방법을 개발하기 위해.
  • 낮은 품질의 응답을 경고하는 수치적 신뢰도 점수를 제공하여 LLM 출력의 신뢰성을 향상시키기 위해.
  • 추가 학습 없이도 다수의 LLM 생성 응답 중 가장 높은 신뢰도를 가진 응답을 선택하여 정답 정확도를 향상시키기 위해.
  • 신뢰도 기반 필터링을 통해 인간이 참여하는 평가와 완전히 자동화된 평가 모두에서 LLM 출력의 신뢰성 있는 평가를 가능하게 하기 위해.

제안 방법

  • BSDetector는 동일한 LLM으로부터 다양한 온도 설정과 프롬프트 변형을 사용해 다수의 응답을 샘플링한다.
  • 생성된 응답 간의 의미적 유사도를 문장 임베딩 모델을 사용해 측정함으로써 신뢰도 점수를 계산한다.
  • 다중 샘플링에 걸친 응답 일관성에 기반해 신뢰도 점수를 도출하며, 낮은 점수는 높은 불확실성 또는 환각 가능성과 관련된다.
  • 내재적(응답 일관성) 및 외재적(의미적 유사도) 평가를 활용해 신뢰도를 추정한다.
  • 모델의 미세조정 없이도 다수의 생성 응답 중 가장 높은 신뢰도를 가진 응답을 선택함으로써 정확도를 향상시킨다.
  • 낮은 신뢰도 응답을 사전에 필터링함으로써 인간이 참여하는 평가와 완전히 자동화된 평가 모두를 지원한다.
(a) Pipeline of BSDetector , which can be applied to any LLM API. ( $T=1.0$ means temperature sampling with parameter 1.0, Sim ( $\cdot$ , $\cdot$ ) means the semantic similarities between two sentences.)
(a) Pipeline of BSDetector , which can be applied to any LLM API. ( $T=1.0$ means temperature sampling with parameter 1.0, Sim ( $\cdot$ , $\cdot$ ) means the semantic similarities between two sentences.)

실험 결과

연구 질문

  • RQ1학습 데이터나 아키텍처 정보에 접근할 수 없더라도, 블랙박스 LLM의 불확실성을 신뢰성 있게 측정할 수 있는가?
  • RQ2다수의 LLM 생성 응답 중 가장 높은 신뢰도를 가진 응답을 선택하는 것이 재학습 없이도 정답 정확도를 향상시키는가?
  • RQ3BSDetector의 신뢰도 점수는 인간이 참여하는 평가와 완전히 자동화된 평가 환경 모두에서 LLM 기반 평가의 신뢰성을 향상시키는가?
  • RQ4신뢰도 기반 필터링은 랜덤 필터링 대비 평가 점수의 분산을 줄이고 정확도를 향상시키는 데 얼마나 효과적인가?
  • RQ5기본 기준 불확실성 측정 방법에 비해 BSDetector는 질문-답변 벤치마크에서 오류율을 얼마나 줄이는가?

주요 결과

  • BSDetector는 GPT-3와 ChatGPT를 포함한 닫힘 영역 및 열린 영역 QA 벤치마크에서 잘못된 LLM 응답을 식별하는 데 있어 다른 불확실성 측정 방법보다 뛰어난 성능을 보였다.
  • 다수의 LLM 생성 응답 중 가장 높은 신뢰도를 가진 응답을 선택함으로써 추가 학습 없이도 정답 정확도가 향상되었다.
  • 인간이 참여하는 평가 환경에서, 인간 평가 응답 중 신뢰도 기반 선택이 랜덤 선택보다 오류율을 낮추었으며, TriviaQA와 Summarize-from-feedback 데이터셋 모두에서 신뢰성 향상을 이뤘다.
  • 완전히 자동화된 평가 환경에서는 가장 낮은 20%의 신뢰도를 가진 응답을 기각함으로써 더 정확한 평균 GPT-4 평가 점수를 달성했으며, MSE 개선과 함께 TriviaQA에서 정확도 1.0에 도달했다.
  • 랜덤으로 20%의 응답을 기각하는 것은 정확도 향상 없이 분산만 증가시켰으며, 이는 신뢰도 기반 필터링이 의미 있는 성능 향상을 제공한다는 것을 확인시켰다.
  • 이 방법은 GPT-3.5와 GPT-4를 포함한 다양한 LLM과 사실 기반 QA, 요약 등 응용 유형 전반에서 효과적이며, 광범위한 적용 가능성을 입증했다.
(b) Two prompts from a Trivia Q&A dataset (Joshi et al., 2017 ) and the responses from ChatGPT, along with the associated confidence scores from BSDetector .
(b) Two prompts from a Trivia Q&A dataset (Joshi et al., 2017 ) and the responses from ChatGPT, along with the associated confidence scores from BSDetector .

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.