[論文レビュー] Alleviating Hallucinations of Large Language Models through Induced Hallucinations
本稿では、大規模言語モデルにおける幻覚を軽減するための軽量なデコード手法であるInduce-then-Contrast Decoding (ICD) を提案する。この手法は、まず弱いモデルで幻覚を誘発し、その後、対照的デコードを用いて生成段階でそれらをペナルティ化することで、幻覚を緩和する。ICDは事実性を著しく向上させ、Llama2-7B-Chat および Mistral-7B-Instruct が TruthfulQA において GPT-3.5 および GPT-4 の性能に並ぶことを可能にする。
Despite their impressive capabilities, large language models (LLMs) have been observed to generate responses that include inaccurate or fabricated information, a phenomenon commonly known as ``hallucination''. In this work, we propose a simple extit{Induce-then-Contrast} Decoding (ICD) strategy to alleviate hallucinations. We first construct a factually weak LLM by inducing hallucinations from the original LLMs. Then, we penalize these induced hallucinations during decoding to enhance the factuality of the generated content. Concretely, we determine the final next-token predictions by amplifying the predictions from the original model and downplaying the induced untruthful predictions via contrastive decoding. Experimental results on both discrimination-based and generation-based hallucination evaluation benchmarks, such as TruthfulQA and extsc{FActScore}, demonstrate that our proposed ICD methods can effectively enhance the factuality of LLMs across various model sizes and families. For example, when equipped with ICD, Llama2-7B-Chat and Mistral-7B-Instruct achieve performance comparable to ChatGPT and GPT4 on TruthfulQA, respectively.
研究の動機と目的
- 強力な全体的性能を示すにもかかわらず、事実誤認や捏造された内容を生成するという、大規模言語モデルにおける幻覚問題を恒常的に解決すること。
- モデル重みの変更や膨大な微調整を必要とせず、デコード段階での手法によって事実性を向上させること。
- 弱いモデルに幻覚を誘発することで、元のモデルにおける非事実的生成を特定・抑制するための代理指標としての有効性を検証すること。
- 多様なモデルサイズおよびモデルファミリーにわたって評価し、広範な適用可能性と頑健性を確保すること。
- データ集約的または学習ベースの幻覚軽減手法に対する、軽量で効率的かつ効果的な代替手法を提供すること。
提案手法
- 元のLLMに対してわずかな微調整またはゼロショットプロンプティングを用いて、事実的に弱いLLMを構築する。
- 対照的デコードを用いて、元のモデルの予測を強調し、幻覚誘発モデルの予測を抑制する。
- 元のモデルと幻覚誘発モデルの出力を比較することで、トークンの確率を調整する対照的損失メカニズムを適用する。
- パラメータ効率の良い微調整(LoRA)を活用し、幻覚誘発弱モデルを最小限の計算負荷で訓練する。
- 元のモデルの出力と、誘発された幻覚的トークンに対する対照的ペナルティを組み合わせてデコードし、非事実的生成を抑制する。
- 二段階の推論プロセスを採用:まず両モデルから生成を行い、その後対照的デコードを適用して最終出力を精練する。
実験結果
リサーチクエスチョン
- RQ1弱いモデルに幻覚を誘発することは、元のLLMにおける非事実的生成を特定・抑制するための効果的な代理指標として機能するか?
- RQ2事実的モデルと幻覚誘発モデルの間で対照的デコードを適用することで、LLM出力の事実性が著しく向上するか?
- RQ3ICDは、Llama2、Mistral およびそれらのチャットバージョンを含む、さまざまなモデルアーキテクチャおよびサイズでどのように性能を発揮するか?
- RQ4ICDは、事実データによる直接的微調整を上回る、事実精度と応答品質を達成できるか?
- RQ5ICDはモデルの整合性および応答長にどのような影響を及ぼし、RLHFで学習された元の有用性を保持しているか?
主な発見
- ICD は Llama2-7B-Chat の TruthfulQA MC1 スコアを +8 ポイント、Mistral-7B-Instruct を +20 ポイント向上させ、それぞれ GPT-3.5 および GPT-4 の性能に並ぶようになる。
- FActScore ベンチマークにおいて、ICD を適用した Llama2-7B-Chat は事実精度スコア 66.3 を達成し、同じモデルの 70B バージョンを上回る。
- ICD は、ウィキペディアの人物情報で直接微調整する手法よりも幻覚をより効果的に低減するが、後者では新たな幻覚が生じ、応答品質が低下した。
- ICD は短縮化や有用性の喪失がしばしば見られる直接微調整手法と比較して、高い応答品質と長さを維持する。
- ICD は、7B および 70B パラメータのバリエーションを含む複数のモデルファミリーおよびサイズで一貫した性能向上を示す。
- ICD は二重のフォワードパスによるため、推論遅延が 1.6 倍に増加するが、LoRA を用いた微調整のおかげで GPU メモリオーバーヘッドは無視できるほど小さい。
より良い研究を、今すぐ始めましょう
論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。
クレジットカード登録不要
このレビューはAIが作成し、人間の編集者が確認しました。