Skip to main content
QUICK REVIEW

[論文レビュー] AutoHall: Automated Factuality Hallucination Dataset Generation for Large Language Models

Zouying Cao, Yifei Yang|arXiv (Cornell University)|Sep 30, 2023
Topic Modeling被引用数 5
ひとこと要約

本稿では、公開の事実確認データセットを活用して、手作業によるアノテーションが不要なモデル固有の幻覚データセットを自動生成するAutoHallを提案する。さらに、モデルが出力する参照同士の自己矛盾に基づくゼロリソースでブラックボックスな幻覚検出手法を導入し、ChatGPTおよびLlama-2モデルにおいて、ベースライン比でF1スコアが20-30%高い性能を達成した。

ABSTRACT

Large language models (LLMs) have gained broad applications across various domains but still struggle with hallucinations. Currently, hallucinations occur frequently in the generation of factual content and pose a great challenge to trustworthy LLMs. However, hallucination detection is hindered by the laborious and expensive manual annotation of hallucinatory content. Meanwhile, as different LLMs exhibit distinct types and rates of hallucination, the collection of hallucination datasets is inherently model-specific, which also increases the cost. To address this issue, this paper proposes a method called $ extbf{AutoHall}$ for $\underline{Auto}$matically constructing model-specific $\underline{Hall}$ucination datasets based on existing fact-checking datasets. The empirical results reveal variations in hallucination proportions and types among different models. Moreover, we introduce a zero-resource and black-box hallucination detection method based on self-contradiction to recognize the hallucination in our constructed dataset, achieving superior detection performance compared to baselines. Further analysis on our dataset provides insight into factors that may contribute to LLM hallucinations. Our codes and datasets are publicly available at https://github.com/zouyingcao/AutoHall.

研究の動機と目的

  • LLMにおける幻覚検出データセット作成のための高コストかつ時間のかかる手作業アノテーションの問題を解決すること。
  • 人間によるラベル付けが不要な、自動的かつスケーラブルなモデル固有の幻覚データセット作成手法の開発。
  • モデルの内部応答のみに依存するゼロリソースでブラックボックスな幻覚検出を可能にすること。
  • さまざまなLLMにおける幻覚の頻度、種別、分布を調査すること。
  • モデルが出力する複数の参照同士の自己矛盾分析を用いて、幻覚検出性能の向上を図ること。

提案手法

  • WICE、Climate-Fever、PubHealthなど既存の公開事実確認データセットを活用し、主張とその真偽ラベル(事実的/事実でない)を抽出する。
  • ターゲットとなるLLMを用いて、各主張に対して複数の参照を生成し、これらを幻覚的または事実的な応答とみなす。
  • 主張の真偽ラベルと一致するか否かに基づいて、生成された参照を自動的に幻覚的または事実的とラベル付けする。
  • 主張とLLMが出力した参照、およびそれらに対応するラベルをペアにしたモデル固有の幻覚データセット(AutoHall)を構築する。
  • 1つの主張に対してK個の参照をサンプリングし、それらの間で自己矛盾を検出することで、ゼロリソースの幻覚検出手法を実装する。
  • 矛盾を示すペアの数を指標とする:矛盾ペアの数が多いほど、幻覚の可能性が高くなる。

実験結果

リサーチクエスチョン

  • RQ1既存の事実確認データセットを活用して、手作業アノテーションなしにモデル固有の幻覚データセットを自動生成できるか?
  • RQ2複数のLLMが出力する参照同士の自己矛盾検出は、幻覚の同定にどの程度有効か?
  • RQ3ChatGPT や Llama-2 などの異なるLLMにおいて、幻覚の頻度とトピック分布はどのようになっているか?
  • RQ4温度や比較ペア数(K)といったハイパーパrameterが、幻覚検出性能にどのように影響するか?
  • RQ5提案手法は、既存のゼロリソースおよび外部知識に基づく幻覚検出ベースラインと比較して、性能で優れているか?

主な発見

  • AutoHallは、手作業アノテーションが不要な状態で、モデル固有の幻覚データセットを自動的に生成することに成功した。
  • 提案された自己矛盾に基づく検出手法は、ChatGPTおよびLlama-2モデルの両方で、既存のベースライン比でF1スコアが20-30%向上した。
  • 単一参照法と比較して、複数の参照比較を用いることで、幻覚検出のF1スコアが平均で8.91%向上した。
  • テストされたモデル全体を通じて、LLM出力における幻覚の割合は20%から30%の間と推定された。
  • ChatGPTが生成する幻覚は、歴史、技術、文化、地理、ビジネスの分野で最も頻発するが、Llama-2-chatは政治、スポーツ、地理分野でより多くの幻覚を示した。
  • 幻覚的参照では、事実的参照よりも著しく自己矛盾ペアの数が多く(ChatGPT T=0.9時、平均矛盾数:2.75)、幻覚的でない場合(平均:1.79)と比較して、本手法の識別能が裏付けられた。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。