[論文レビュー] HalluDial: A Large-Scale Benchmark for Automatic Dialogue-Level Hallucination Evaluation
HalluDialは、4,094件の対話(146,856件のサンプル)をカバーする、自動対話レベルの幻覚評価のための最初の大規模ベンチマークです。factualityおよびfaithfulnessの幻覚を含み、幻覚検出、局所化、根拠生成を通じて包括的な評価を可能にし、HalluJudgeのような専用のジャッジモデルの開発を支援します。HalluJudgeは自動幻覚評価において優れたパフォーマンスを達成しています。
Large Language Models (LLMs) have significantly advanced the field of Natural Language Processing (NLP), achieving remarkable performance across diverse tasks and enabling widespread real-world applications. However, LLMs are prone to hallucination, generating content that either conflicts with established knowledge or is unfaithful to the original sources. Existing hallucination benchmarks primarily focus on sentence- or passage-level hallucination detection, neglecting dialogue-level evaluation, hallucination localization, and rationale provision. They also predominantly target factuality hallucinations while underestimating faithfulness hallucinations, often relying on labor-intensive or non-specialized evaluators. To address these limitations, we propose HalluDial, the first comprehensive large-scale benchmark for automatic dialogue-level hallucination evaluation. HalluDial encompasses both spontaneous and induced hallucination scenarios, covering factuality and faithfulness hallucinations. The benchmark includes 4,094 dialogues with a total of 146,856 samples. Leveraging HalluDial, we conduct a comprehensive meta-evaluation of LLMs' hallucination evaluation capabilities in information-seeking dialogues and introduce a specialized judge language model, HalluJudge. The high data quality of HalluDial enables HalluJudge to achieve superior or competitive performance in hallucination evaluation, facilitating the automatic assessment of dialogue-level hallucinations in LLMs and providing valuable insights into this phenomenon. The dataset and the code are available at https://github.com/FlagOpen/HalluDial.
研究の動機と目的
- factualityおよびfaithfulnessの両方の幻覚をカバーする、対話レベルの幻覚評価ベンチマークが不足している問題に対処すること。
- 既存のベンチマークが文書レベルや文単位の幻覚に限定されており、局所化や根拠生成を無視しているという限界を克服すること。
- 人的リソースを多く要するか、非専門的な評価者に依存するのを減らし、自動的で高品質な幻覚評価を可能にすること。
- 対話の幻覚検出に特化したジャッジモデルの訓練および評価のための包括的リソースを提供すること。
- 体系的な幻覚評価を通じて、より信頼性が高く信頼できるLLMベースの対話システムの開発を支援すること。
提案手法
- ベンチマークは、情報探索対話データセットから構築され、自然発生的および誘発的(induced)な幻覚状況を含んでいます。
- 自然発生的幻覚は、2段階のパイプライン(多様な対話の抽出 → LLMを用いた自動アノテーション)によって生成されます。
- 誘発的幻覚は、GPT-4にタスク固有の指示を提示することで、明確な説明を伴う幻覚的応答を生成させることで作成されます。
- 各サンプルには、幻覚検出、局所化(スパンレベル)、根拠(自然言語による説明)が含まれており、解釈可能性が保証されています。
- データセットは、幻覚の検出、局所化、根拠提示という3次元評価をサポートする構造になっています。
- 専用のジャッジモデルであるHalluJudgeは、HalluDial上で学習され、対話システムにおける高精度な自動幻覚評価を可能にしています。
実験結果
リサーチクエスチョン
- RQ1既存の幻覚ベンチマークは、どれほど対話レベルの幻覚を包括的に評価できていないのか?
- RQ2現在の手法は、対話文脈において幻覚をどれほど効果的に局所化し、解釈可能な根拠を提供できるのか?
- RQ3大規模かつ多次元的な幻覚ベンチマーク上で学習された専用ジャッジモデルは、一般のLLMを上回る性能を発揮できるのか?
- RQ4HalluDialを用いた自動評価と、人間によるアノテーションベースラインとの比較的パフォーマンスはどのようになるのか?
- RQ5factualityとfaithfulnessの幻覚は、対話システムにおいてどのように異なる形で現れ、検出可能なのか?
主な発見
- HalluDialは4,094件の対話と146,856件のサンプルを含み、対話レベルの幻覚評価において公開済みで最大のベンチマークです。
- ベンチマークは幻覚検出、局所化、根拠生成という3つの主要な評価タスクをサポートしており、解釈可能性と信頼性が向上しています。
- HalluDial上で学習された専用ジャッジモデルであるHalluJudgeは、一般のLLMと比較して優れた、または同等のパフォーマンスを発揮しています。
- 誘発的幻覚生成手法は、明確な説明を伴う多様で高品質な幻覚的サンプルを効果的に生成でき、ベンチマークのカバレッジが向上しています。
- データセットは一貫性があり再現可能な評価を可能にし、高コストの人間アノテーションや一貫性のないAPIベースのLLM評価者に依存するのを減らしています。
- HalluDialはGitHub上でCC BY-NC-SAライセンスのもとで公開されており、継続的な研究およびモデル開発を支援しています。
より良い研究を、今すぐ始めましょう
論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。
クレジットカード登録不要
このレビューはAIが作成し、人間の編集者が確認しました。