Skip to main content
QUICK REVIEW

[논문 리뷰] Llamas Know What GPTs Don't Show: Surrogate Models for Confidence Estimation

Vaishnavi Shrivastava, Percy Liang|arXiv (Cornell University)|2023. 11. 15.
Topic Modeling인용 수 4
한 줄 요약

이 논문은 GPT-4 및 Claude-v1.3와 같은 최신의 블랙박스 LLM에서 내부 확률을 노출하지 않기 때문에, 신뢰도를 추정하기 위한 서브티튜트 모델 접근법을 제안한다. 동일한 입력에 대해 더 약한, 오픈소스 모델(예: Llama 2)의 신뢰도 점수를 사용함으로써, 12개의 질의응답 데이터셋에서 평균 AUC 84.6%를 달성하며, 언어적 신뢰도 유도 및 동시 논문들보다 뛰어난 성능을 보였다.

ABSTRACT

To maintain user trust, large language models (LLMs) should signal low confidence on examples where they are incorrect, instead of misleading the user. The standard approach of estimating confidence is to use the softmax probabilities of these models, but as of November 2023, state-of-the-art LLMs such as GPT-4 and Claude-v1.3 do not provide access to these probabilities. We first study eliciting confidence linguistically -- asking an LLM for its confidence in its answer -- which performs reasonably (80.5% AUC on GPT-4 averaged across 12 question-answering datasets -- 7% above a random baseline) but leaves room for improvement. We then explore using a surrogate confidence model -- using a model where we do have probabilities to evaluate the original model's confidence in a given question. Surprisingly, even though these probabilities come from a different and often weaker model, this method leads to higher AUC than linguistic confidences on 9 out of 12 datasets. Our best method composing linguistic confidences and surrogate model probabilities gives state-of-the-art confidence estimates on all 12 datasets (84.6% average AUC on GPT-4).

연구 동기 및 목표

  • GPT-4 및 Claude-v1.3와 같은 최신 LLM에서 내부 소프트맥스 확률을 노출하지 않기 때문에, 신뢰도 점수를 신뢰성 있게 추정하는 문제를 해결한다.
  • 모델이 스스로 자신의 신뢰도를 보고하도록 유도하는 언어적 신뢰도 유도의 한계인 굵은 티의, 반복적인 출력을 해결하기 위해 이를 개선한다.
  • 더 작은, 오픈소스 서브티튜트 모델에서 얻을 수 있는 접근 가능한 확률을 활용해, 블랙박스 LLM의 신뢰도를 실용적이고 저비용으로 추정하는 방법을 개발한다.
  • 서브티튜트 모델이 타겟 모델과 다르거나 더 약할지라도, 서브티튜트 모델의 확률이 효과적으로 전이되어 신뢰도 추정을 향상시킬 수 있음을 입증한다.
  • 언어적 신뢰도와 서브티튜트 모델의 확률을 조합하여 다양한 벤치마크에서 선택적 분류 성능을 최고 수준으로 향상시킨다.

제안 방법

  • 타겟 LLM(예: GPT-4)에 다양한 프롬프트 형식을 사용해 자신의 답변에 대한 신뢰도를 평가하도록 유도함으로써 언어적 신뢰도를 유도한다.
  • 내부 소프트맥스 확률에 액세스할 수 있는 서브티튜트 모델(예: Llama 2, text-davinci-003)을 사용해 동일한 입력에 대한 신뢰도 점수를 생성한다.
  • 타겟 모델의 언어적 신뢰도와 서브티튜트 모델의 확률 기반 신뢰도를 혼합하여 신뢰도 추정치를 구성한다.
  • 언어적 신뢰도와 서브티튜트 신뢰도 점수를 가중 조합하여 정확한 예측과 잘못된 예측 간의 분리도를 향상시킨다.
  • 12개의 다양한 질의응답 데이터셋(MMLU, TruthfulQA, MedQA 포함)에서 선택적 분류 AUC를 주요 평가 지표로 사용한다.
  • 체인 오브 타ught 및 흩어진 샘플 형식을 포함한 다양한 모델(GPT-4, Claude-v1.3, GPT-3.5, Llama 2, text-davinci-003)과 프롬프트 변형에 대해 복수의 검증을 수행한다.
Figure 1: Our goal is to provide good confidence estimates for state-of-the-art LLMs like GPT-4 and Claude-v1.3 which currently do not give access to their internal probabilities. One natural approach (GPT-4 Linguistic) is to prompt the model asking for its confidence. Interestingly, we find that ta
Figure 1: Our goal is to provide good confidence estimates for state-of-the-art LLMs like GPT-4 and Claude-v1.3 which currently do not give access to their internal probabilities. One natural approach (GPT-4 Linguistic) is to prompt the model asking for its confidence. Interestingly, we find that ta

실험 결과

연구 질문

  • RQ1내부 확률이 노출되지 않은 상황에서 언어적 신뢰도 유도가 모델의 불확실성을 신뢰성 있게 추정할 수 있는가?
  • RQ2더 약하고 오픈소스인 서브티튜트 모델의 신뢰도 추정치가 GPT-4와 같은 강력한 블랙박스 LLM의 신뢰도 추정을 얼마나 향상시킬 수 있는가?
  • RQ3서브티튜트 모델이 훨씬 작거나 정확도가 낮더라도, 왜 모델 간에 신뢰도가 전이될 수 있는가?
  • RQ4언어적 신뢰도와 서브티튜트 모델의 확률이 서로 어떻게 보완되어 전체적인 신뢰도 추정 성능을 향상시키는가?
  • RQ5복잡하고 비용이 많이 드는 방법(예: 자기 일관성)보다, 단순한 언어적 및 서브티튜트 신뢰도 점수의 혼합이 더 뛰어난 성능을 낼 수 있는가?

주요 결과

  • GPT-4에서 언어적 신뢰도 유도는 12개 데이터셋 평균 AUC 80.5%를 기록한다—무작위 기준보다 7% 높지만, 내부 확률이 이용 가능한 경우에 비해 크게 떨어진다.
  • Llama 2의 확률을 사용한 서브티튜트 신뢰도 추정은 GPT-4의 평균 AUC를 82.1%까지 향상시키며, 언어적 신뢰도만 사용하는 것보다 뛰어난 성능을 보였다.
  • 언어적 신뢰도와 서브티튜트 모델의 확률을 조합하면 GPT-4의 평균 AUC가 83.4%까지 상승하여 두 신호 간의 보완성이 입증되었다.
  • 최고 성능을 보인 방법—언어적 및 서브티튜트 신뢰도 점수의 혼합—은 12개 모든 데이터셋에서 GPT-4의 평균 AUC 84.6%를 달성하며 최신 기술 수준에 도달했다.
  • 더 약한 서브티튜트 모델인 Llama 2-13B나 text-davinci-003조차도 GPT-4 및 Claude-v1.3에서 언어적 신뢰도보다 유사하거나 더 높은 AUC를 기록하여 강력한 전이 가능성(transferability)을 보였다.
  • 자기 일관성(self-consistency)을 사용하는 동시 논문(Xiong et al., 2023)보다 성능이 뛰어나며, 이는 입력당 5번의 GPT-4 호출이 필요하고 계산 비용이 더 높기 때문이다.
Figure 2: Linguistic Confidence Prompt Instruction for the best linguistic confidence prompt (see exact prompt in Appendix A.4 ).
Figure 2: Linguistic Confidence Prompt Instruction for the best linguistic confidence prompt (see exact prompt in Appendix A.4 ).

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.