Skip to main content
QUICK REVIEW

[論文レビュー] Rowen: Adaptive Retrieval-Augmented Generation for Hallucination Mitigation in LLMs

Hanxing Ding, Liang Pang|arXiv (Cornell University)|Feb 16, 2024
Epilepsy research and treatment被引用数 4
ひとこと要約

Rowen は、多言語的摂動における内部推論の一貫性が欠ける場合にのみ外部検索を動的に有効化することで、大規模言語モデル(LLMs)における幻覚を軽減する、革新的で適応性のあるリtrieval増強生成フレームワークである。既存の手法と比較して著しく少ない検索呼び出し回数で最先端の幻覚軽減性能を達成している。

ABSTRACT

Hallucinations present a significant challenge for large language models (LLMs). The utilization of parametric knowledge in generating factual content is constrained by the limited knowledge of LLMs, potentially resulting in internal hallucinations. While incorporating external information can help fill knowledge gaps, it also introduces the risk of irrelevant information, thereby increasing the likelihood of external hallucinations. To balance the use of parametric knowledge within LLMs and external information, in this study, we present Rowen, a novel framework that enhances LLMs with an adaptive retrieval augmentation process tailored to address hallucinated outputs. Rowen introduces a consistency-based hallucination detection module, which assesses the model's uncertainty regarding the input query by evaluating the semantic inconsistencies in various responses generated across different languages or models. When high uncertainties in the responses are detected, Rowen activates the retrieval of external information to rectify the model outputs. Through comprehensive empirical experiments, we demonstrate that Rowen surpasses the current state-of-the-art in both detecting and mitigating hallucinated content within the outputs of LLMs.

研究の動機と目的

  • 大規模言語モデル(LLMs)における内部的幻覚(制限されたパrametric知識によるもの)と外部的幻覚(不適切な検索によるもの)の二重の課題に対処すること。
  • 必要最小限の検索のみを有効化する手法を開発し、不要な外部証拠の注入を最小限に抑えること。
  • 多言語的意味的感度検出メカニズムを用いて、LLM出力の事実的一致性と信頼性を向上させること。
  • 冗長な検索呼び出しを削減することで、事実の正確性と推論効率の両立を図ること。
  • LLM推論における内部パrametric知識と外部証拠の調和ある統合を可能にすること。

提案手法

  • Rowen は、与えられたクエリを複数の言語にまたがって意味的に同等のバージョンに摂動する多言語的意味的感度検出モジュールを採用している。
  • 異なる言語での摂動クエリに対する応答の一貫性を評価し、一貫性の欠如は内部的幻覚の兆候であると判断する。
  • 一貫性の欠如が検出された場合、Rowen は関連する外部証拠を用いて出力を是正するリtrieval増強生成プロセスを起動する。
  • 応答が複数言語で一貫している場合、元の内部推論が保持され、不必要な検索が回避される。
  • 検索が必要かどうかを判断するためのしきい値ベースの一貫性メトリクスを用いて、検出感度と検索コストのバランスを取る。
  • 内部推論が信頼できない場合にのみ検索を有効化することで、内部的および外部的幻覚の両方を最小限に抑えるように設計されている。

実験結果

リサーチクエスチョン

  • RQ1RQ1: 多言語的一致性チェックは、LLMsにおける内部的幻覚を効果的に検出できるか?
  • RQ2RQ2: 一貫性検出に基づく適応的検索は、常に有効な検索と比較して、事実の正確性をどのように向上させるか?
  • RQ3RQ3: 検出と検索のオーバーヘッドの両立を最適化するための、一貫性ベースの検索有効化の最適なしきい値は何か?
  • RQ4RQ4: 摂動クエリの数が、検出性能と計算コストにどのように影響するか?
  • RQ5RQ5: 検索効率と幻覚軽減の観点から、既存のRAG手法と比較してRowenはどのように異なるか?

主な発見

  • Rowen は、TruthfulQA および StrategyQA ベンチマークの両方で最先端の幻覚軽減性能を達成している。
  • Rowen は、TruthfulQA では1問あたり平均1.5回、StrategyQA では0.5回の検索呼び出しにまで削減しており、FLARE(2.1および3.9)や Detect-and-Mitigate(7.2および5.5)を上回っている。
  • 一貫性しきい値0.6が、検出精度と不適切な検索による外部的幻覚のリスクの両立を最適にバランスさせる。
  • 6つの摂動クエリを使用することで、ほぼ最適な性能が得られ、それ以上に増やすと利得が逓減するため、効率的な展開が可能になる。
  • 内部推論が一貫していて信頼できる場合には検索を回避することで、外部的幻覚のリスクを顕著に低減している。
  • Rowen の適応的メカニズムにより、比較対象のすべての手法よりも少ない検索呼び出し回数で、事実の正確性を維持または向上させている。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。