Skip to main content
QUICK REVIEW

[論文レビュー] Measuring and Reducing LLM Hallucination without Gold-Standard Answers

Jiaheng Wei, Yuanshun Yao|arXiv (Cornell University)|Feb 16, 2024
Plant-based Medicinal Research被引用数 8
ひとこと要約

FEWLは、金標準の回答がない設定向けに設計された幻覚メトリックで、専門家が重みづけした参照LLMと怠惰ペナルティを用い、ICLとLF-SFTによる幻覚を減らす方法、および金標準を用いない設定で幻覚研究を促進するCHALEベンチマークを含みます。

ABSTRACT

LLM hallucination, i.e. generating factually incorrect yet seemingly convincing answers, is currently a major threat to the trustworthiness and reliability of LLMs. The first step towards solving this complicated problem is to measure it. However, existing hallucination metrics require having a benchmark dataset with gold-standard answers, i.e. "best" or "correct" answers written by humans. Such requirements make hallucination measurement costly and prone to human errors. In this work, we propose Factualness Evaluations via Weighting LLMs (FEWL), an innovative hallucination metric that is specifically designed for the scenario when gold-standard answers are absent. FEWL leverages the answers from off-the-shelf LLMs that serve as a proxy of gold-standard answers. The key challenge is how to quantify the expertise of reference LLMs resourcefully. We show FEWL has certain theoretical guarantees and demonstrate empirically it gives more accurate hallucination measures than naively using reference LLMs. We also show how to leverage FEWL to reduce hallucination through both in-context learning and supervised fine-tuning. Extensive experiment results on Truthful-QA, CHALE, and HaluEval datasets demonstrate the effectiveness of FEWL.

研究の動機と目的

  • 金標準の回答が利用できない場合のLLM幻覚の測定を動機づける。
  • FEWL (F actualness Evaluations via Weighting LLMs) を専門家重み付けの代理ベースの真実性指標として紹介する。
  • 金標準が欠如する状況下でFEWLと最適解を結びつける理論的保証を提供する。
  • FEWLを用いてIn-context learningおよび教師ありファインチューニングを通じて幻覚を減らすための方法を示す。
  • no-gold-standard設定での幻覚研究を促進する大規模CHALEベンチマークを公開する。

提案手法

  • 参照LLMの回答を、参照LLMが意図的に誤った(IW)回答にどの程度แตกし、訂正された(CO)回答と同意するかから導出されたlambda_i(x)を用いて、専門家重み付けされた真実性スコアを計算する。
  • 同じトピック内の近接質問間で参照LLMの回答の類似度を評価し、表面的にもっとらしくとも誤っている回答を罰する怠惰ペナルティを導入する。
  • 2つの成分をf-divergenceの変分形(例: Total-Variation)を用いて統合しFEWLを生成する。
  • アルゴリズム的手順には、複数の参照LLMに問い合わせ、IW/CO回答を生成し、lambda_i(x)を計算し、KNN質問に対して怠惰ペナルティを計算し、f-divergence形で結合することを含む。
  • 金標準の回答がなくてもFEWLが最良のLLMを最高位にランク付けするという理論的保証を提供する。

実験結果

リサーチクエスチョン

  • RQ1参照LLMを活用することで、金標準の回答なしでFEWLは幻覚を信頼性高く測定できるか?
  • RQ2専門家重み付けされた参照と怠惰ペナルティは、素朴な参照ベースの指標と比較して幻覚測定の精度を改善するか?
  • RQ3FEWLは金標準ラベルなしでインコンテキスト学習と教師ありファインチューニングを通じて幻覚を低減するのに使用できるか?
  • RQ4FEWLは真の非幻覚率と相関し、幻覚傾向に基づいてLLMを正しくランク付けするか?
  • RQ5ゴールド標準データなしで幻覚指標を評価する大規模ベンチマークとして CHA LE を使用することの影響は?

主な発見

  • FEWLはCHALEおよびTruthful-QAにおいて、非幻覚回答と幻覚または半幻覚回答を区別する性能でベースラインを上回る。
  • 専門家重み付けと怠惰ペナルティを用いたFEWLは、参照LLMとしてGPT-3.5およびGPT-4を用いた場合でも、非幻覚回答に対してベースラインより高いスコアを得る。
  • FEWLはLLMを幻覚傾向で正確にランク付けし、Truthful-QAの真の非幻覚率と一致する。
  • FEWL誘導のインコンテキスト学習は、ベースラインICLよりも回答品質を向上させる。
  • FEWLで選択された回答を用いたラベルなし教師ありファインチューニングは、事前学習済みのベースラインを上回る勝利率をもたらし、真のラベル付けに近づく。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。