Skip to main content
QUICK REVIEW

[논문 리뷰] Alleviating Hallucinations of Large Language Models through Induced Hallucinations

Yue Zhang, Leyang Cui|arXiv (Cornell University)|2023. 12. 25.
Topic Modeling인용 수 4
한 줄 요약

이 논문은 대규모 언어 모델의 환각 현상을 완화하기 위해 먼저 약한 모델에서 환각을 유도한 다음, 대조적 디코딩을 통해 디코딩 중에 이를 보상하는 경량 디코딩 방법인 Induce-then-Contrast Decoding (ICD)을 제안한다. ICD는 사실성에 상당한 기여를 하여 Llama2-7B-Chat와 Mistral-7B-Instruct가 TruthfulQA에서 GPT-3.5 및 GPT-4의 성능에 맞추어진다.

ABSTRACT

Despite their impressive capabilities, large language models (LLMs) have been observed to generate responses that include inaccurate or fabricated information, a phenomenon commonly known as ``hallucination''. In this work, we propose a simple extit{Induce-then-Contrast} Decoding (ICD) strategy to alleviate hallucinations. We first construct a factually weak LLM by inducing hallucinations from the original LLMs. Then, we penalize these induced hallucinations during decoding to enhance the factuality of the generated content. Concretely, we determine the final next-token predictions by amplifying the predictions from the original model and downplaying the induced untruthful predictions via contrastive decoding. Experimental results on both discrimination-based and generation-based hallucination evaluation benchmarks, such as TruthfulQA and extsc{FActScore}, demonstrate that our proposed ICD methods can effectively enhance the factuality of LLMs across various model sizes and families. For example, when equipped with ICD, Llama2-7B-Chat and Mistral-7B-Instruct achieve performance comparable to ChatGPT and GPT4 on TruthfulQA, respectively.

연구 동기 및 목표

  • 강력한 전반적 성능에도 불구하고 사실적으로 잘못되거나 위조된 내용을 생성하는 대규모 언어 모델에서 지속적인 환각 문제를 해결하기 위해.
  • 모델 가중치나 광범위한 피팅 트레이닝을 변경하지 않고도 사실성을 향상시키는 디코딩 수준의 방법을 개발하기 위해.
  • 약한 모델에서 환각을 유도하는 것이 원본 모델에서 비현실적인 생성물을 식별하고 억제하는 데 유용한 프록시가 될 수 있는지 탐색하기 위해.
  • 다양한 모델 크기와 아키텍처에 걸쳐 성능을 평가하여 광범위한 적용 가능성과 강건성을 확보하기 위해.
  • 데이터 집약적이거나 학습 기반의 환각 완화 기법에 비해 경량이며 효율적이고 효과적인 대안을 제공하기 위해.

제안 방법

  • 약한 LLM을 만들기 위해 원본 LLM에 약간의 피팅 트레이닝 또는 제로샷 프롬프팅을 통해 환각을 유도한다.
  • 원본 모델의 예측을 강화하고 환각 유도 모델의 예측을 약화시키기 위해 대조적 디코딩을 사용한다.
  • 원본 모델과 환각 유도 모델의 출력을 비교하여 토큰 확률을 조정하는 대조 손실 메커니즘을 적용한다.
  • LoRA 기반의 파rameter 효율적 피팅을 활용하여 환각을 유도하는 약한 모델을 최소한의 계산 부담으로 학습한다.
  • 원본 모델의 출력과 환각 토큰에 대한 대조적 보상 조합을 통해 비현실적인 생성물을 억제하기 위해 디코딩을 수행한다.
  • 이중 단계 추론 프로세스를 활용: 먼저 두 모델에서 생성하고, 그 다음 대조적 디코딩을 적용하여 최종 출력을 개선한다.

실험 결과

연구 질문

  • RQ1약한 모델에서 환각을 유도하는 것이 원본 LLM에서 비현실적인 생성물을 식별하고 억제하는 데 효과적인 프록시가 될 수 있는가?
  • RQ2사실적인 모델과 환각 유도 모델 간의 대조적 디코딩이 LLM 출력의 사실성에 상당한 향상 효과를 가지는가?
  • RQ3ICD는 Llama2, Mistral 및 그 챗 버전을 포함한 다양한 모델 아키텍처와 크기에서 어떻게 성능을 내는가?
  • RQ4정확한 사실 데이터로 직접 피팅 트레이닝하는 것에 비해 ICD가 사실 정확성과 응답 품질 측면에서 더 우수한가?
  • RQ5ICD는 모델의 통일성과 응답 길이에 어떤 영향을 미치며, RLHF를 통해 학습된 원래의 유용성은 유지되는가?

주요 결과

  • ICD는 Llama2-7B-Chat의 TruthfulQA MC1 점수를 +8점 향상시키고, Mistral-7B-Instruct는 +20점 향상시켜 각각 GPT-3.5 및 GPT-4의 성능에 맞춘다.
  • FActScore 벤치마크에서 ICD를 적용한 Llama2-7B-Chat은 사실 정확도 점수 66.3을 기록하여 동일한 모델의 70B 버전을 능가한다.
  • ICD는 위키백과 생애사진 데이터로 직접 피팅 트레이닝하는 것보다 환각을 더 효과적으로 줄이며, 새로운 환각을 유도하고 응답 품질을 떨어뜨리는 문제를 피한다.
  • 이 방법은 짧아짐과 유용성 손실이 자주 발생하는 직접 피팅 트레이닝 접근 방식에서 보이는 문제를 피하면서도 높은 응답 품질과 길이를 유지한다.
  • ICD는 Llama2, Mistral 등 여러 모델 패밀리와 크기에서 일관된 성능 향상을 보이며, 7B 및 70B 파라미터 버전 모두에서 유사한 효과를 나타낸다.
  • 이중 순전파로 인한 인퍼런스 지연은 1.6배로 증가하며, LoRA 기반 피팅으로 인해 GPU 메모리 오버헤드는 거의 없어진다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.