Skip to main content
QUICK REVIEW

[논문 리뷰] RAGTruth: A Hallucination Corpus for Developing Trustworthy Retrieval-Augmented Language Models

Cheng Niu, Yuanhao Wu|arXiv (Cornell University)|2023. 12. 31.
Topic Modeling인용 수 5
한 줄 요약

이 논문은 다양한 작업과 모델을 대상으로 18,000개의 RAG 생성 응답을 포함하고 있으며, 단어 수준의 환각 현상 레이블이 수작업으로 라벨링된 대규모 수준의 RAGTruth라는 코퍼스를 소개한다. 이는 Llama-2-13B와 같은 작은 LLM을 RAGTruth로 미세조정함으로써 GPT-4 기반 프롬프트 방법과 경쟁 가능한 환각 현상 탐지 성능을 달성하며, 선택적 샘플링을 통해 생성된 출력의 환각 빈도를 크게 감소시킨다.

ABSTRACT

Retrieval-augmented generation (RAG) has become a main technique for alleviating hallucinations in large language models (LLMs). Despite the integration of RAG, LLMs may still present unsupported or contradictory claims to the retrieved contents. In order to develop effective hallucination prevention strategies under RAG, it is important to create benchmark datasets that can measure the extent of hallucination. This paper presents RAGTruth, a corpus tailored for analyzing word-level hallucinations in various domains and tasks within the standard RAG frameworks for LLM applications. RAGTruth comprises nearly 18,000 naturally generated responses from diverse LLMs using RAG. These responses have undergone meticulous manual annotations at both the individual cases and word levels, incorporating evaluations of hallucination intensity. We not only benchmark hallucination frequencies across different LLMs, but also critically assess the effectiveness of several existing hallucination detection methodologies. Furthermore, we show that using a high-quality dataset such as RAGTruth, it is possible to finetune a relatively small LLM and achieve a competitive level of performance in hallucination detection when compared to the existing prompt-based approaches using state-of-the-art large language models such as GPT-4.

연구 동기 및 목표

  • 검증된 환각 현상 평가를 위한 고품질, 대규모 데이터셋이 RAG 시나리오에서 부족한 문제를 해결하기 위해.
  • 자연스럽게 생성된 응답을 사용하여 다양한 LLM이 RAG 설정에서 환각 빈도를 어떻게 가지는지 벤치마킹하기 위해.
  • RAG 환경에서의 문단 수준 및 단어 수준에서 기존 환각 현상 탐지 방법의 효과성을 평가하기 위해.
  • 대규모 모델을 사용하는 프롬프트 기반 방법보다 뛰어난 성능을 보이는, 미세조정 기반 환각 현상 탐지 접근법을 개발하고 검증하기 위해.
  • 미세조정된 소형 LLM이 GPT-4와 같은 저환각 모델에서도 생성된 출력에서 환각 현상을 효과적으로 억제할 수 있음을 보여주기 위해.

제안 방법

  • 다양한 도메인과 작업을 대상으로 주요 오픈소스 및 비공개 소스 LLM들로부터 약 18,000개의 자연스러운 RAG 응답을 수집하였다.
  • 고품질의 세밀한 평가 데이터를 확보하기 위해 환각 현상의 강도 점수까지 포함한 단어 수준의 정밀한 수작업 라벨링을 수행하였다.
  • RAGTruth 코퍼스를 사용하여 스파니드 수준의 환각 현상 탐지에 대해 GPT-4-turbo를 포함한 여러 기존 환각 현상 탐지 방법을 벤치마킹하였다.
  • RAGTruth 학습 데이터를 기반으로 Llama-2-13B 모델을 미세조정하여 전용 환각 현상 탐지 모델을 구축하였다.
  • 두 가지 샘플링 전략을 제안하고 평가하였으며, 각각 감지된 환각 스팬 수가 적은 응답을 선택하거나, 환각 스팬이 전혀 감지되지 않은 응답을 선택하는 방식이었다.
  • 랜덤 선택, 탐지기 기반 선택, 기준 모델 간의 환각 빈도 비교를 통해 환각 억제 성능을 평가하였다.

실험 결과

연구 질문

  • RQ1다양한 작업과 도메인에서 RAG 프레임워크 하에 생성된 응답에 대해 다양한 LLM이 환각 빈도에서 어떻게 다를까?
  • RQ2기존의 환각 현상 탐지 방법, 특히 GPT-4-turbo는 RAG 생성 콘텐츠의 단어 수준 환각 현상을 어느 정도 효과적으로 식별할 수 있을까?
  • RQ3RAGTruth와 같은 고품질 환각 현상 코퍼스에 기반해 소형 LLM을 미세조정하면, 최신 모델인 GPT-4를 사용하는 프롬프트 기반 방법과 경쟁 가능한 탐지 성능을 달성할 수 있을까?
  • RQ4미세조정된 환각 현상 탐지기로 응답 샘플링 전략을 적용함으로써 LLM 출력의 환각 빈도를 효과적으로 감소시킬 수 있을까?
  • RQ5RAG 환경에서 다양한 유형의 환각 스팬(예: 명백한 vs. 암묵적인)에 대해 환각 현상의 탐지 가능성은 어떻게 다를까?

주요 결과

  • RAGTruth 코퍼스는 다양한 작업과 모델을 대상으로 약 18,000개의 완전히 라벨링된 자연스러운 RAG 응답을 포함하고 있으며, 세밀한 단어 수준의 환각 현상 레이블이 제공된다.
  • GPT-4-turbo는 RAGTruth에서 스팬 수준의 F1 스코어가 단지 48.4%에 그치며, 정밀도는 24%에 불과하여 스팬 수준에서 환각 현상을 탐지하는 데서 최적의 성능을 내지 못함을 시사한다.
  • Llama-2-13B를 RAGTruth로 미세조정한 결과, 경쟁 가능한 F1 스코어 48.4%를 달성하였으며, 이는 소형 모델이 프롬프트 기반 GPT-4 접근법과 동등한 성능을 낼 수 있음을 보여준다.
  • 미세조정된 탐지기를 사용해 두 개의 응답 중에서 선택적으로 샘플링함으로써, Llama-2-7B-chat의 경우 환각 빈도가 56.6% 감소했고, GPT-4의 경우 52.9% 감소했으며, 이는 본질적으로 낮은 환각 빈도를 가지는 모델에서도 효과적임을 보여준다.
  • 명백한 환각 현상의 탐지 성능는 암묵적인 환각 현상의 탐지 성능보다 유의미하게 높았으며, 이는 암묵적인 사실적 모순을 식별하는 데서의 어려움을 시사한다.
  • 환각 스팬이 전혀 감지되지 않은 응답을 선택하는 전략이, 감지된 스팬 수를 최소화하는 전략보다 더 뛰어난 성능을 보였으며, 특히 저환각 모델에서 두드러졌다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.