[論文レビュー] HALoGEN: Fantastic LLM Hallucinations and Where to Find Them
HALOGENは、9つのタスク全体で14のLLMの幻覚を定量化・分類する大規模でマルチドメインのベンチマークを提示し、自動的な原子単位検証と、訓練データ由来と創作由来を探る新しいエラーメ taxonomyを導入する。
Despite their impressive ability to generate high-quality and fluent text, generative large language models (LLMs) also produce hallucinations: statements that are misaligned with established world knowledge or provided input context. However, measuring hallucination can be challenging, as having humans verify model generations on-the-fly is both expensive and time-consuming. In this work, we release HALoGEN, a comprehensive hallucination benchmark consisting of: (1) 10,923 prompts for generative models spanning nine domains including programming, scientific attribution, and summarization, and (2) automatic high-precision verifiers for each use case that decompose LLM generations into atomic units, and verify each unit against a high-quality knowledge source. We use this framework to evaluate ~150,000 generations from 14 language models, finding that even the best-performing models are riddled with hallucinations (sometimes up to 86% of generated atomic facts depending on the domain). We further define a novel error classification for LLM hallucinations based on whether they likely stem from incorrect recollection of training data (Type A errors), or incorrect knowledge in training data (Type B errors), or are fabrication (Type C errors). We hope our framework provides a foundation to enable the principled study of why generative models hallucinate, and advances the development of trustworthy large language models.
研究の動機と目的
- 長文生成における幻覚の有病率を多様な領域で測定する。
- モデル出力を原子事実に分解し、各単位を信頼できる情報源と照合して検証する。
- 訓練データまたは創作における幻覚エラーの潜在的起源を分類する。
- LLMが幻覚を起こす理由とそれを減らす方法を研究するためのマルチドメインデータセットとツールを提供する。
提案手法
- 応答ベースおよび拒否ベースの設定を含む9つのタスクでHALOGENを構築する。
- タスク固有のパーサーまたはプロンプトを用いてモデル出力を自動的に原子事実へ分解する。
- 外部ソースやLLMベースの分類器(例:Package Index、Semantic Scholar、含意/外延検査など)を用いて各原子単位を検証する。
- 分解と検証結果から幻覚、応答比率、有用性スコアを定義・算出する。
- 前提データとの関係に基づくエラータイプ(タイプA、B、C)を割り当てるために幻覚に注釈を付ける。
- 幻覚を前訓練コーパス(例:C4、OpenWebText)および文脈源に遡って帰属を分析する。
実験結果
リサーチクエスチョン
- RQ1最先端のLLMが多様な領域で示す幻覚の有病率はどの程度か。
- RQ2幻覚は領域とタスクタイプ(コード、要約、伝記、科学的帰属など)によってどのように異なるか。
- RQ3自動検証器は生成テキストの原子単位を信頼性高く分解・事実性判断できるか。
- RQ4訓練データ由来と創作由来(タイプA対タイプB対タイプC)の主な幻覚源は何か。
- RQ5モデルサイズ・アーキテクチャ・オープン性は幻覚率と拒否挙動にどう影響するか。
主な発見
- LLMsはタスク全体で substantial な幻覚を示し、領域とモデルに応じて幻覚率は4%から86%に及ぶ。
- 幻覚パターンは領域依存であり、より大きなモデルは応答ベースのタスクの一部で幻覚が少なくなる傾向がある一方、拒否ベースのタスクでは必ずしもそうではない。
- GPT-3.5およびGPT-4(クローズドモデル)は多くのタスクで最も強い事実性能を示す一方、Llama-2やMistralなどのオープンモデルはカテゴリによって異なる。
- コードパッケージ幻覚の大半は訓練データに由来する(タイプB)一方、いくつかの事実誤りは訓練データ中の正確な事実が誤用された(タイプA)ことに起因する。
- 高有用性モデル間では、内容に基づく要約は固有の幻覚(文脈処理エラー)を主要なエラー源とする。
- 要約タスクでは、幻覚の83%が内在的(文脈処理)で、17%が外在的(外部事実の導入)である。
より良い研究を、今すぐ始めましょう
論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。
クレジットカード登録不要
このレビューはAIが作成し、人間の編集者が確認しました。