Skip to main content
QUICK REVIEW

[論文レビュー] Minimizing Factual Inconsistency and Hallucination in Large Language Models

I Muneeswaran, Shreya Saxena|arXiv (Cornell University)|Nov 23, 2023
Topic Modeling被引用数 4
ひとこと要約

本稿では、回答を生成する前に、根拠を生成・検証・精錬するマルチステージフレームワークを提案する。このアプローチにより、大規模言語モデルにおける事実の不一致や事実の捏造(ホールキュレーション)が顕著に低減される。ライフサイエンス分野の薬物関連の質問において、標準的なRAGと比較して忠実度が14–25%向上し、正確性が16–22%向上する。微調整を施したLlama2-7Bは、微調整を行わないバージョンと比較して33–42%高い正確性を達成する。

ABSTRACT

Large Language Models (LLMs) are widely used in critical fields such as healthcare, education, and finance due to their remarkable proficiency in various language-related tasks. However, LLMs are prone to generating factually incorrect responses or "hallucinations," which can lead to a loss of credibility and trust among users. To address this issue, we propose a multi-stage framework that generates the rationale first, verifies and refines incorrect ones, and uses them as supporting references to generate the answer. The generated rationale enhances the transparency of the answer and our framework provides insights into how the model arrived at this answer, by using this rationale and the references to the context. In this paper, we demonstrate its effectiveness in improving the quality of responses to drug-related inquiries in the life sciences industry. Our framework improves traditional Retrieval Augmented Generation (RAG) by enabling OpenAI GPT-3.5-turbo to be 14-25% more faithful and 16-22% more accurate on two datasets. Furthermore, fine-tuning samples based on our framework improves the accuracy of smaller open-access LLMs by 33-42% and competes with RAG on commercial models.

研究の動機と目的

  • 高リスク分野(医療や薬物警戒)における大規模言語モデル(LLM)の事実の不一致やホールキュレーションという深刻な問題に対処すること。
  • 根拠の生成と出典の参照を組み込むことで、LLMが出力する回答の透明性とトレーサビリティを向上させること。
  • 回答がキュレートされた知識リポジトリや検証可能な出典に根ざしている必要がある産業応用分野におけるLLMの信頼性を向上させること。
  • このフレームワークが、バイオメディカルQAタスクにおいて標準的なリtrieval-Augmented Generation(RAG)を上回る忠実度と正確性を示すことを実証すること。
  • このフレームワークの出力データを用いて、より小さなオープンソースLLMを微調整することで、商用モデルのRAGと同等の性能を達成できることを示すこと。

提案手法

  • 最終回答を生成する前に、段階的に根拠を生成することで、論理的進行と事実の根拠づけを保証する。
  • 誤ったまたは一貫性のない推論要素を検出・是正するための根拠検証モジュールと精錬モジュールを含む。
  • 精錬された根拠を支援的根拠として使用し、最終的な回答を生成することで、トレーサビリティと信頼性が向上する。
  • 事実がキュレートされた知識ソース(例:PubMed、社内データベース)からの検索を用いて、根拠と回答を根拠づける。
  • フレームワークは2つのデータセットを用いて評価された:PubmedQA(公開)およびAEQA(社内で副作用反応に特化したエキスパートキュレーション済み)。
  • フレームワークの出力データを用いて、より小さなオープンソースモデル(例:Llama2-7B)を微調整することで性能を向上させる。

実験結果

リサーチクエスチョン

  • RQ1根拠の検証と精錬を含むマルチステージ推論フレームワークは、LLMにおける事実の捏造を低減できるか?
  • RQ2バイオメディカルQAタスクにおいて、提案されたフレームワークは標準的なRAGと比較して忠実度と正確性の面で優れているか?
  • RQ3このフレームワークの出力データを用いて、より小さなオープンソースLLMを微調整することで、非微調整バージョンと比較してどの程度性能が向上するか?
  • RQ4全文パラグラフではなく構造化された三項組(triplets)を入力として使用することで、コンテキスト長を短縮できるが、性能に顕著な低下を来さないか?
  • RQ5特定の知識ソースへの回答のトレーサビリティを可能にすることで、フレームワークは透明性を向上させられるか?

主な発見

  • PubmedQAデータセットにおいて、RAGと比較して忠実度が14.1%向上し、正確性が15.82%向上した。
  • 社内AEQAデータセットでは、RAGと比較して忠実度が25.04%向上し、正確性が21.66%向上した。
  • フレームワークの出力データで微調整されたLlama2-7Bモデルは、非微調整バージョンと比較して33–42%高い正確性を示した。
  • パラグラフを全量検索するRAG + FEバージョンは、96.85%の正確性と83.24%の忠実度を達成し、すべてのアブレーションバージョンを上回った。
  • 根拠検証モジュールと精錬モジュールは顕著な貢献を示しており、これらを削除すると正確性は93.78%、忠実度は80.26%に低下した。
  • パラグラフ入力ではなく三項組を用いることで、入力トークン長は6.5倍短縮されたが、忠実度(76.96%)と正確性(91.27%)はパラグラフ入力に比べて低下した。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。