Skip to main content
QUICK REVIEW

[논문 리뷰] Cycles of Thought: Measuring LLM Confidence through Stable Explanations

Evan Becker, Stefano Soatto|arXiv (Cornell University)|2024. 06. 05.
Auction Theory and ApplicationsDecision Sciences인용 수 3
한 줄 요약

이 논문은 대규모 언어 모델(Large Language Model, LLM)의 불확실성 측정을 위한 새로운 프레임워크를 제안한다. 이 방법은 생성된 설명의 안정성 분석을 통해 불확실성을 측정하며, 각 설명-답안 쌍을 테스트 시기 분류기로 간주한다. 설명 포함성 추론를 사용하여 이러한 분류기들에 대한 사후 분포를 계산함으로써, 다섯 가지 다양한 벤치마크에서 선택적 불확실성(AUROC 및 AURC) 측정에서 최신 기술 수준의 성능을 달성한다. 특히 복잡한 추론 작업에서 뚜렷한 향상을 보였다.

ABSTRACT

In many high-risk machine learning applications it is essential for a model to indicate when it is uncertain about a prediction. While large language models (LLMs) can reach and even surpass human-level accuracy on a variety of benchmarks, their overconfidence in incorrect responses is still a well-documented failure mode. Traditional methods for ML uncertainty quantification can be difficult to directly adapt to LLMs due to the computational cost of implementation and closed-source nature of many models. A variety of black-box methods have recently been proposed, but these often rely on heuristics such as self-verbalized confidence. We instead propose a framework for measuring an LLM's uncertainty with respect to the distribution of generated explanations for an answer. While utilizing explanations is not a new idea in and of itself, by interpreting each possible model+explanation pair as a test-time classifier we can calculate a posterior answer distribution over the most likely of these classifiers. We demonstrate how a specific instance of this framework using explanation entailment as our classifier likelihood improves confidence score metrics (in particular AURC and AUROC) over baselines across five different datasets. We believe these results indicate that our framework is both a well-principled and effective way of quantifying uncertainty in LLMs.

연구 동기 및 목표

  • 높은 위험도를 지닌 응용 분야에서 LLM의 잘못된 예측에 대한 과신 문제를 해결하기 위해.
  • 모델 가중치나 내부 상태에 접근할 필요가 없는 블랙박스 불확실성 정량화 방법을 개발하기 위해.
  • 기존 히ュ리스틱 방법을 초월하여, 올바른 예측와 잘못된 예측를 구분하는 선택적 불확실성 성능을 향상시키기 위해.
  • 설명 기반 분류기의 전도적 마진화를 통해 불확실성 추정을 체계화하기 위해.
  • 다양하고 복잡한 벤치마크를 통해 방법의 강건성과 일반화 능력을 평가하기 위해.

제안 방법

  • 이 방법은 LLM이 생성한 각 설명-답안 쌍을 테스트 시기 분류기로 간주하여 가능한 분류기들의 분포를 형성한다.
  • 설명 포함성 추론을 사용하여 분류기의 가능성에 대한 사후 예측 분포를 계산하며, 이를 통해 분류기의 가능성을 추정한다.
  • 설명 포함성은 답변과 논리적으로 일관된지 확인함으로써 설명을 걸러내고 재가중함으로써 신뢰도 캘리브레이션을 향상시킨다.
  • 이 프레임워크는 테스트 시기의 사슬-오프-사고 추론을 활용하지만, 내용 그 자체보다는 설명의 안정성에 초점을 맞춘다.
  • 최종 신뢰도 점수는 안정적이고 포함성 검증을 통과한 설명-답안 쌍들의 분포에서 유도된다.
  • 이 방법은 GPT-3.5와 GPT-4를 사용하여 구현되었으며, 표준 불확실성 측정 지표를 사용해 다섯 가지 다양한 데이터셋에서 평가되었다.
Figure 1 : Empirical distribution of explanation log likelihoods (top left) and explanation entailment probabilities (top right) generated for the TruthQA dataset using token logits from GPT3.5-Turbo. Red denotes explanations generated by conditioning on the incorrect answer and blue denotes explana
Figure 1 : Empirical distribution of explanation log likelihoods (top left) and explanation entailment probabilities (top right) generated for the TruthQA dataset using token logits from GPT3.5-Turbo. Red denotes explanations generated by conditioning on the incorrect answer and blue denotes explana

실험 결과

연구 질문

  • RQ1모델 내부 정보에 접근할 수 없는 상황에서 설명의 안정성이 LLM의 신뢰도에 대한 신뢰할 수 있는 대체 지표가 될 수 있는가?
  • RQ2설명 기반 분류기의 가중치를 포함성 추론을 통해 조정하면, 기존 방법에 비해 선택적 불확실성 성능이 향상되는가?
  • RQ3이 방법은 복잡도가 다른 데이터셋, 특히 추론 중심의 작업에서 어떻게 성능을 내는가?
  • RQ4히ュ리스틱적 자기 언어화에 의존하지 않고, 잘못된 답변에 대한 과신을 어느 정도 줄일 수 있는가?
  • RQ5테스트 시기의 설명 분포를 사용하여 LLM에서 베이지안 사후 예측 분포를 근사할 수 있는가?

주요 결과

  • 제안된 안정적인 설명 기반 신뢰도 방법은 다섯 개의 데이터셋 평균에서 모든 기준 방법을 능가하며, 선택적 불확실성 측정에서 최고의 AUROC와 AURC 점수를 기록했다.
  • MMLU 전문법 분야 데이터셋에서, GPT-3.5-Turbo를 사용해 AUROC 0.784와 AURC 0.131를 기록했으며, 다음으로 좋은 방법보다 뚜렷이 뛰어났다.
  • GPT-4-Turbo를 사용한 경우, CommonsenseQA에서 AUROC 0.899와 AURC 0.131를 기록하여 복잡한 추론 작업에서 뛰어난 성능을 보였다.
  • 절단 실험 결과, 포함성 재가중과 설명 조건부 답변 분포의 조합이 개별 구성 요소보다 더 뛰어난 성능을 내는 것으로 확인되었다.
  • 기존 방법이 자주 실패하는 복잡하고 다단계의 추론 문제(예: MMLU 법학 및 물리학)에서 특히 높은 성과를 기록했다.
  • 선택적 불확실성에서의 높은 성과에도 불구하고, 캘리브레이션(ECE) 성능은 최신 기술 수준이 아니었으며, 이는 ECE가 분포 이동 하에서 본질적인 한계를 지닌다는 점을 저자들이 기인했다.
Figure 3 : Stable Explanation Prompts
Figure 3 : Stable Explanation Prompts

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.