[논문 리뷰] HalluDial: A Large-Scale Benchmark for Automatic Dialogue-Level Hallucination Evaluation
HalluDial은 대화 수준의 환각 평가를 위한 최초의 대규모 벤치마크를 소개하며, 4,094개의 대화(146,856개 샘플)를 포함해 사실성과 충실성 환각을 모두 다룹니다. 이는 환각 탐지, 국소화, 근거 생성을 통해 종합적인 평가를 가능하게 하며, HalluJudge와 같은 전문화된 심사 모델의 개발을 지원합니다. HalluJudge는 자동 환각 평가에서 뛰어난 성능을 기록합니다.
Large Language Models (LLMs) have significantly advanced the field of Natural Language Processing (NLP), achieving remarkable performance across diverse tasks and enabling widespread real-world applications. However, LLMs are prone to hallucination, generating content that either conflicts with established knowledge or is unfaithful to the original sources. Existing hallucination benchmarks primarily focus on sentence- or passage-level hallucination detection, neglecting dialogue-level evaluation, hallucination localization, and rationale provision. They also predominantly target factuality hallucinations while underestimating faithfulness hallucinations, often relying on labor-intensive or non-specialized evaluators. To address these limitations, we propose HalluDial, the first comprehensive large-scale benchmark for automatic dialogue-level hallucination evaluation. HalluDial encompasses both spontaneous and induced hallucination scenarios, covering factuality and faithfulness hallucinations. The benchmark includes 4,094 dialogues with a total of 146,856 samples. Leveraging HalluDial, we conduct a comprehensive meta-evaluation of LLMs' hallucination evaluation capabilities in information-seeking dialogues and introduce a specialized judge language model, HalluJudge. The high data quality of HalluDial enables HalluJudge to achieve superior or competitive performance in hallucination evaluation, facilitating the automatic assessment of dialogue-level hallucinations in LLMs and providing valuable insights into this phenomenon. The dataset and the code are available at https://github.com/FlagOpen/HalluDial.
연구 동기 및 목표
- 사실성과 충실성 환각을 모두 포함하는 대화 수준의 환각 평가 벤치마크가 부족한 문제를 해결하기 위해.
- 기존의 벤치마크가 문장 또는 문단 수준의 환각에만 집중하고 국소화 및 근거 생성을 간과하는 등의 한계를 극복하기 위해.
- 노력이 많이 들거나 전문화되지 않은 평가자에 대한 의존도를 줄이기 위해 자동화되고 고품질의 환각 평가를 가능하게 하기 위해.
- 대화 환각 탐지 전용 심사 모델의 훈련 및 평가를 위한 종합적 자원을 제공하기 위해.
- 체계적인 환각 평가를 통해 더 신뢰할 수 있고 신뢰도가 높은 LLM 기반 대화 시스템의 개발을 지원하기 위해.
제안 방법
- 벤치마크는 정보 탐색 대화 데이터셋에서 유래되었으며, 자연스럽게 발생하는 환각과 유도된 환각 시나리오를 모두 포함합니다.
- 자연스럽게 발생하는 환각은 다각도의 대화 샘플링 후 LLM을 이용한 자동 주석 처리를 통해 이중 단계 파이프라인으로 생성됩니다.
- 유도된 환각은 GPT-4에 작업에 특화된 지시문을 제공하여 명시적인 설명이 포함된 환각 응답을 생성함으로써 만들어집니다.
- 각 샘플에는 환각 탐지, 국소화(스팬 수준), 근거(자연어 설명)가 포함되어 있어 해석 가능성을 보장합니다.
- 데이터셋은 환각의 탐지, 국소화, 정당화를 위한 다차원 평가를 지원하도록 구성되어 있습니다.
- HalluDial에서 훈련된 전문화된 심사 모델인 HalluJudge는 대화 시스템 내에서 고성능의 자동 환각 평가를 가능하게 합니다.
실험 결과
연구 질문
- RQ1기존의 환각 벤치마크가 대화 수준의 환각을 얼마나 포괄적으로 평가하지 못하는가?
- RQ2현재의 방법들은 대화 맥락에서 환각을 얼마나 효과적으로 국소화하고 해석 가능한 근거를 제공하는가?
- RQ3대규모 다차원 환각 벤치마크에서 훈련된 전문화된 심사 모델이 일반 LLM보다 환각 평가에서 뛰어난 성능을 보일 수 있는가?
- RQ4HalluDial를 이용한 자동 평가의 성능은 인간 주석 기반 기준과 비교해 어떻게 되는가?
- RQ5사실성 환각과 충실성 환각은 대화 시스템에서 어떻게 다르게 나타나며, 탐지 가능성은 어떻게 다를까?
주요 결과
- HalluDial은 4,094개의 대화와 146,856개의 샘플을 포함하여 대화 수준의 환각 평가를 위한 가장 큰 공개 벤치마크입니다.
- 벤치마크는 환각 탐지, 국소화, 근거 생성이라는 세 가지 핵심 평가 과제를 지원하여 해석 가능성과 신뢰도를 향상시킵니다.
- HalluDial에서 훈련된 전문화된 심사 모델인 HalluJudge는 일반 LLM과 비교해 뛰어난 성능 또는 경쟁력을 기록합니다.
- 유도된 환각 생성 방법은 명확한 설명이 함께하는 다양한 고품질의 환각 샘플을 효과적으로 생성하여 벤치마크의 커버리지가 향상됩니다.
- 데이터셋은 일관되고 재현 가능한 평가를 가능하게 하여 고비용의 인간 주석이나 일관성 없는 API 기반 LLM 평가자에 대한 의존도를 감소시킵니다.
- HalluDial는 GitHub에서 CC BY-NC-SA 라이선스 하에 공개되어 있으며, 지속적인 연구 및 모델 개발을 지원합니다.
더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.