[論文レビュー] Mitigating Knowledge Conflicts in Language Model-Driven Question Answering
本稿では、記憶されたパrametric知識への過剰な依存を軽減することで、言語モデル駆動型質問応答における幻覚を緩和するため、ボトルネックおよびプリフィックスアダプタを用いたプロンプトチューニングを提案する。これらの手法は誤った記憶を上書きするのに成功し、KMIRテストセットで92.9%、NQで64.8%の精度を達成し、性能の損ないなしに入力文脈への忠実性が向上することを示している。
In the context of knowledge-driven seq-to-seq generation tasks, such as document-based question answering and document summarization systems, two fundamental knowledge sources play crucial roles: the inherent knowledge embedded within model parameters and the external knowledge obtained through context. Recent studies revealed a significant challenge: when there exists a misalignment between the model's inherent knowledge and the ground truth answers in training data, the system may exhibit problematic behaviors during inference, such as ignoring input context, or generating unfaithful content. Our investigation proposes a strategy to minimize hallucination by building explicit connection between source inputs and generated outputs. We specifically target a common hallucination pattern in question answering, examining how the correspondence between entities and their contexts during model training influences the system's performance at inference time.
研究の動機と目的
- パラメトリック知識への過剰な依存が原因で生じる事実の幻覚を、言語モデル駆動型質問応答において是正すること。
- モデルが入力文脈を無視し、記憶された事実に基づいて回答を生成するような、エンティティベースの知識的矛盾を軽減すること。
- 文脈の根拠が不十分な状況下でもモデルの行動を制約する学習スキームを開発し、入力への忠実性を向上させること。
- プロンプトチューニングにアダプタを組み合わせることで、記憶された知識を上書き可能かどうかを評価すること。
- 入力文脈と生成出力との明示的相関が幻覚を減少させることを示すこと。
提案手法
- モデルの挙動を制御するため、直交的な2つのプロンプトチューニング手法(ボトルネックアダプタおよびプリフィックスチューニングアダプタ)を提案する。
- 微調整中に、シャッフルされた文脈的に正しい答えを新たなターゲットとして用いることで、記憶された誤った答えを上書きする。
- 推論時に入力文脈への注目を促進するために、勾配ベースのデコードを適用する。
- アダプタを用いた微調整により、生成された答えを入力文脈と明示的に一致させ、パラメトリック知識への依存を最小限に抑える。
- 正解が置き換えられたデータセットでモデルを学習させ、正しい文脈に基づいた出力に向けた誘導が可能かどうかをテストする。
- 入力の変更に対する注目度を測るため、元の例および変更済みの例における正確一致精度を用いて性能を評価する。
実験結果
リサーチクエスチョン
- RQ1プロンプトチューニング手法は、言語モデルにおける記憶されたパラメトリック知識を上書き可能であり、幻覚を低減できるか?
- RQ2ボトルネックアダプタおよびプリフィックスアダプタは、質問応答におけるモデルの入力文脈への忠実性をどの程度向上できるか?
- RQ3入力文脈と生成出力との明示的相関は、エンティティベースの知識的矛盾を減少させるか?
- RQ4正解が文脈的に正しいものに置き換えられた場合、モデルの性能はどのように変化するか?
- RQ5モデルは、記憶された事実ではなく、入力文脈に基づいて一貫して正しい回答を生成できるように訓練可能か?
主な発見
- ボトルネックアダプタは、KMIRテストセットで92.9%の精度を達成し、誤った記憶された答えを上書きする強力な性能を示した。
- より複雑なNQデータセットでは、プリフィックスチューニングを用いたモデルが64.8%の精度を達成し、複雑さにもかかわらず文脈への注目が効果的に維持されたことが示された。
- 両手法とも、定性的な例を通じて、モデルの出力を記憶された誤った答えから文脈的に正しいものへと変更できた。
- 正確一致評価により、モデルが置き換えられた答えを生成できる能力が確認され、入力文脈への注目度が向上したことが示された。
- 結果から、アダプタを用いたプロンプトチューニングは、顕著な性能低下なしに幻覚を効果的に緩和できることを示している。
- 本研究では、入力と出力との明示的相関がパラメトリック知識への過剰な依存を低減し、事実の整合性を向上させることを示している。
より良い研究を、今すぐ始めましょう
論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。
クレジットカード登録不要
このレビューはAIが作成し、人間の編集者が確認しました。