Skip to main content
QUICK REVIEW

[논문 리뷰] Trusting Your Evidence: Hallucinate Less with Context-aware Decoding

Weijia Shi, Xiaochuang Han|arXiv (Cornell University)|2023. 05. 24.
Topic Modeling인용 수 7
한 줄 요약

이 논문은 대조적 확률 조정을 통해 이전 지식보다 입력 컨텍스트에 더 의존하도록 출력 확률을 보정함으로써 언어 모델의 신뢰성(faithfulness)을 향상시키는 no-fine-tuning, 추론 시기 방법인 컨텍스트 인식 디코딩(CAD)을 소개한다. CAD는 요약 작업에서 LLaMA-30B에서 사실성 지표를 14.3% 향상시키고, 지식 충돌 QA 작업에서는 최대 2.9배의 성능 향상을 이끌어내어 환상적인 모델 편향을 효과적으로 보완한다.

ABSTRACT

Language models (LMs) often struggle to pay enough attention to the input context, and generate texts that are unfaithful or contain hallucinations. To mitigate this issue, we present context-aware decoding (CAD), which follows a contrastive output distribution that amplifies the difference between the output probabilities when a model is used with and without context. Our experiments show that CAD, without additional training, significantly improves the faithfulness of different LM families, including OPT, GPT, LLaMA and FLAN-T5 for summarization tasks (e.g., 14.3% gain for LLaMA in factuality metrics). Furthermore, CAD is particularly effective in overriding a model's prior knowledge when it contradicts the provided context, leading to substantial improvements in tasks where resolving the knowledge conflict is essential.

연구 동기 및 목표

  • 입력 컨텍스트에 적절히 주의를 기울이지 못하는 언어 모델(LMs)의 문제를 해결하기 위해, 특히 이들이 이전 지식과 모순될 경우에 유의미하게 주의를 기울이지 못하는 경우를 대비하여.
  • 모델의 파rametric 지식이 아닌 컨텍스트 증거에 더 기반한 행동으로 모델의 환상 현상을 줄이기 위해.
  • 재학습이나 아키텍처 변경 없이도 시장에 유통되는, 미세조정되지 않은 LMs에 적용 가능한 방법을 개발하기 위해.
  • 요약 및 지식 충돌 해결과 같은 컨텍스트 민감한 작업에서의 성능 향상을 위해.

제안 방법

  • CAD는 컨텍스트 유무에 따른 확률 간의 차이를 강화함으로써 출력 확률 분포를 수정한다.
  • 하나의 초모수 α를 통해 온도 유사 스케일링을 적용하여 로짓을 재가중한다: softmax[(1+α)logit_with_context − α·logit_without_context].
  • 컨텍스트와 다음 토큰 간의 점별 상호정보량(PMI)을 활용하여 컨텍스트적으로 관련성이 높은 출력을 식별한다.
  • 이 조정은 오직 이전 지식에 기반해 높은 확률을 가지는 출력을 낮추고, 컨텍스트가 존재할 때에만 더 가능성 있게 되는 출력을 선호한다.
  • 이 방법은 추론 시기에 적용되며, 모델의 미세조정이나 아키텍처 변경이 필요하지 않다.
  • 이 방법은 OPT, GPT, LLaMA, FLAN-T5와 같은 다양한 LM 패밀리에 대해 일반적으로 적용 가능하도록 설계되어 있다.
Figure 1: An illustration of context-aware decoding.
Figure 1: An illustration of context-aware decoding.

실험 결과

연구 질문

  • RQ1미세조정 없이도 디코딩 방법이 언어 모델의 입력 컨텍스트에 대한 충실도를 향상시킬 수 있는가?
  • RQ2제공된 컨텍스트와 모순될 경우, 대조적 디코딩 전략이 모델의 이전 지식을 얼마나 효과적으로 대체할 수 있는가?
  • RQ3컨텍스트 인식 디코딩의 효과는 모델 크기에 따라 증가하는가, 특히 지식 충돌 시나리오에서 그러한가?
  • RQ4컨텍스트 주의와 생성 품질을 균형 잡는 데 최적의 조정 수준 α는 무엇인가?
  • RQ5이 방법은 요약 및 QA와 같은 다양한 LM 아키텍처와 작업에 일반화 가능한가?

주요 결과

  • CAD는 CNN-DM 요약 작업에서 LLaMA-30B에 대해 사실성 지표에서 14.3%p의 절대적 향상을 달성했다.
  • 지식 충돌 QA 데이터셋에서 CAD는 표준 디코딩 대비 성능을 2.9배 향상시켰다.
  • CAD의 성능 향상은 모델 크기가 커질수록 증가했으며, 특히 지식 충돌 작업에서 더욱 두드러져 더 큰 모델일수록 이전 지식에 더 강하게 의존하는 경향을 보였다.
  • α = 0.5로 설정할 경우 모든 데이터셋과 모델 크기에서 일관된 향상이 있었고, 충돌이 많은 작업에서는 더 높은 α 값이 추가적인 성능 향상을 가져다주었다.
  • LLaMA-30B에 적용했을 때 CAD는 CNN-DM에서 ROUGE-L 점수를 21% 향상시켜 더 나은 사실성 및 구조적 일치를 보였다.
  • 이 방법은 OPT, GPT, LLaMA, FLAN-T5와 같은 다양한 LM 패밀리에서 효과적이었으며, 광범위한 적용 가능성을 확인했다.
Figure 2: OPT models of varying sizes consistently benefit from CAD. The x-axis indicates the size of language models and the y-axis is the performance.
Figure 2: OPT models of varying sizes consistently benefit from CAD. The x-axis indicates the size of language models and the y-axis is the performance.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.