Skip to main content
QUICK REVIEW

[논문 리뷰] HALoGEN: Fantastic LLM Hallucinations and Where to Find Them

Abhilasha Ravichander, Shrusti Ghela|ArXiv.org|2025. 01. 14.
Mental Health and Psychiatry인용 수 3
한 줄 요약

HALOGEN은 14개의 LLM을 9개 과제에 걸쳐 환각을 정량화하고 분류하기 위한 대규모 다도메인 벤치마크를 제시하며, 자동 원자 단위 검증과 훈련 데이터와 제작 기원을 탐구하는 새로운 오류 분류 체계를 제공합니다.

ABSTRACT

Despite their impressive ability to generate high-quality and fluent text, generative large language models (LLMs) also produce hallucinations: statements that are misaligned with established world knowledge or provided input context. However, measuring hallucination can be challenging, as having humans verify model generations on-the-fly is both expensive and time-consuming. In this work, we release HALoGEN, a comprehensive hallucination benchmark consisting of: (1) 10,923 prompts for generative models spanning nine domains including programming, scientific attribution, and summarization, and (2) automatic high-precision verifiers for each use case that decompose LLM generations into atomic units, and verify each unit against a high-quality knowledge source. We use this framework to evaluate ~150,000 generations from 14 language models, finding that even the best-performing models are riddled with hallucinations (sometimes up to 86% of generated atomic facts depending on the domain). We further define a novel error classification for LLM hallucinations based on whether they likely stem from incorrect recollection of training data (Type A errors), or incorrect knowledge in training data (Type B errors), or are fabrication (Type C errors). We hope our framework provides a foundation to enable the principled study of why generative models hallucinate, and advances the development of trustworthy large language models.

연구 동기 및 목표

  • 다양한 도메인에 걸친 장문 LLM 생성에서 환각의 유병률을 측정한다.
  • 모델 출력물을 원자적 사실로 분해하고 각 단위를 신뢰할 수 있는 소스와 검증한다.
  • 훈련 데이터의 잠재적 기원 또는 제작에 따른 환각 오류를 분류한다.
  • LLM이 왜 환각을 일으키는지 연구하고 이를 감소시키기 위한 다도메인 데이터셋과 도구를 제공한다.

제안 방법

  • 응답 기반 및 거절 기반 설정을 포함하는 아홉 가지 과제와 함께 HALOGEN을 구성한다.
  • 작업 특화 파서나 프롬프트를 사용해 모델 출력을 자동으로 원자적 사실로 분해한다.
  • 각 원자 단위를 외부 소스나 LLM 기반 분류기(예: Package Index, Semantic Scholar, 내재/외재 검증)로 검증한다.
  • 분해 및 검증 결과로부터 환각, 응답 비율, 그리고 유용성 점수를 정의하고 계산한다.
  • 사전 학습 데이터의 관계에 따라 환각에 유형 A, B, C를 부여하도록 주석을 단다.
  • 환각의 기원을 사전 학습 말뭉치(C4, OpenWebText 등)와 맥락 소스까지 추적하여 귀속을 분석한다.

실험 결과

연구 질문

  • RQ1최첨단 LLM에서 다양한 도메인에 걸친 환각의 유병률은 어느 정도인가?
  • RQ2도메인 및 작업 유형(코드, 요약, 전기, 과학적 귀속 등)에 따라 환각은 어떻게 달라지는가?
  • RQ3자동 검증기가 생성된 텍스트에서 원자 단위를 신뢰성 있게 분해하고 사실성을 판정할 수 있는가?
  • RQ4사전 학습 데이터의 주요 환각 기원은 무엇이며(유형 A, 유형 B, 유형 C 중 어느 쪽이 주된 원인인가) 위조에 의한 것과 비교하면 어떤가?
  • RQ5모델 크기, 아키텍처, 공개성은 환각 비율과 거절 행동에 어떤 영향을 미치는가?

주요 결과

  • LLM은 도메인과 모델에 따라 4%에서 86%까지의 비율로 상당한 환각을 보인다.
  • 환각 패턴은 도메인에 의존적이다; 더 큰 모델은 일반적으로 응답 기반 작업에서 환각이 덜하지만 거절 기반 작업에서는 그렇지 않을 수 있다.
  • GPT-3.5 및 GPT-4(비공개 모델)가 많은 과제에서 가장 강한 사실 수행능력을 보이며, Llama-2 및 Mistral과 같은 개방형 모델은 범주에 따라 다양하게 나타난다.
  • 코드-패키지 환각의 큰 부분은 사전 학습 데이터(Type B)에서 비롯되며, 일부 사실 오류(Type A)는 사전 학습에 존재하는 올바른 사실이 잘못 사용되어 발생한다.
  • 콘텐츠-기반 요약은 고유의 환각(맥락 처리 오류)을 높은 유틸리티 모델들 사이에서 지배적 오류 원인으로 갖는다.
  • 요약에서 환각의 83%가 내부적(맥락 처리)이고 17%가 외부적(외부 사실 도입)이다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.