Skip to main content
QUICK REVIEW

[論文レビュー] On the Origin of Hallucinations in Conversational Models: Is it the Datasets or the Models?

Nouha Dziri, Sivan Milton|arXiv (Cornell University)|Apr 17, 2022
Misinformation and Its Impacts被引用数 13
ひとこと要約

本稿では、知識に基づく対話モデルにおける幻覚が訓練データセットかモデルアーキテクチャに起因するかを調査する。3つの主要ベンチマーク(Wizard of Wikipedia、CMU-DoG、TopicalChat)と最先端のモデルを対象とした大規模な人間によるアノテーション研究を通じて、Gold-standardの応答の60%以上が幻覚であることが判明し、モデルの生成はこの問題を悪化させている。研究では、データ品質とモデルの挙動の両方が幻覚に寄与していることが明らかになった。これは、現在のベンチマークと訓練パラダイムの信頼性に疑問を呈するものである。

ABSTRACT

Knowledge-grounded conversational models are known to suffer from producing factually invalid statements, a phenomenon commonly called hallucination. In this work, we investigate the underlying causes of this phenomenon: is hallucination due to the training data, or to the models? We conduct a comprehensive human study on both existing knowledge-grounded conversational benchmarks and several state-of-the-art models. Our study reveals that the standard benchmarks consist of >60% hallucinated responses, leading to models that not only hallucinate but even amplify hallucinations. Our findings raise important questions on the quality of existing datasets and models trained using them. We make our annotations publicly available for future research.

研究の動機と目的

  • 対話型AIにおける幻覚が訓練データかモデルアーキテクチャに起因するかどうかを調査すること。
  • 広く使われている知識に基づく対話ベンチマーク(WoW、CMU-DoG、TopicalChat)の事実的忠実性を監査すること。
  • 最先端のモデルが生成過程で幻覚を悪化させるかどうかを評価すること。
  • 言語的および話法的分析を用いて、幻覚の種類を詳細に分類すること。
  • 将来的な幻覚検出および是正に関する研究のためのアノテーションデータを公開すること。

提案手法

  • Gold-standardおよびモデル生成応答における幻覚を分類するために、BEGIN分類法とVRM(Verbal Response Modes)を用いた人間によるアノテーション研究を実施した。
  • 3つのベンチマークから4,000件の応答と、GPT-2、DoHA、CTRLモデルからの1,200件のモデル生成応答をアノテートした。
  • 資格試験、ピLOTラウンド、および毎日の品質チェックを含む階層的なAmazon Mechanical Turk(AMT)タスク設計を採用し、アノテーションの信頼性を確保した。
  • アノテータ間的一致性を測定するためにFleiss’ Kappaを用い、レーティング担当者間で高い一貫性が得られたことを確認した。
  • 応答を5つのBEGINカテゴリーに分類した:エンタイルメント、幻覚、部分的幻覚、一般化、非協力的。
  • 言語的発話行為(例:開示、教訓、助言)を分析し、幻覚的コンテンツの話法的性質を理解した。

実験結果

リサーチクエスチョン

  • RQ1対話型モデルにおける幻覚は、主に不適切な訓練データか、モデルアーキテクチャに起因するか?
  • RQ2現在の知識に基づくベンチマークにおける応答の何パーセントが事実的に幻覚的であるか?
  • RQ3最先端の対話型モデルは、訓練データに存在する幻覚を生成過程で悪化させるか?
  • RQ4人間およびモデル生成応答におけるさまざまな幻覚タイプを特徴付ける言語的および話法的パターンは何か?
  • RQ5GPT-2、DoHA、CTRLなどの異なるモデルアーキテクチャは、幻覚プロファイルにおいてどのように異なるか?

主な発見

  • 3つの主要ベンチマーク(Wizard of Wikipedia、CMU-DoG、TopicalChat)における応答の60%以上が幻覚であり、その大部分は意見、感情、または個人経験などの裏付けのない主観的コンテンツを含む。
  • 最も頻度の高い幻覚タイプは、主観的表現(例:信念、意図)と裏付けのない事実的主張であり、応答の30〜40%がこれらのカテゴリーに該当する。
  • モデル生成応答はGold-standard応答よりも高い幻覚率を示しており、モデルが既存のデータ欠陥を悪化させていることが示された。
  • 幻覚を低減することを目的としたアーキテクチャ(例:DoHA)ですら、訓練データよりも著しく多くの幻覚的応答を生成しており、アーキテクチャ上の制限が示唆された。
  • BEGIN分類法により、25%の応答が部分的幻覚に該当し、15%が一般化または非協力的であることが判明し、対話品質のさらなる低下が生じた。
  • アノテータ間一致度は高く(Fleiss’ Kappa > 0.75)、アノテーションフレームワークおよび研究結果の信頼性が裏付けられた。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。