[論文レビュー] Trusting Your Evidence: Hallucinate Less with Context-aware Decoding
本稿では、微調整を必要としない推論時手法として、文脈に応じたデコード(CAD)を提案する。CADは、出力確率を対照的に調整することで、モデルの出力を入力文脈への依存性を高め、事前の知識への依存を弱める。この手法により、要約タスクにおけるLLaMA-30Bでは事実性指標が14.3%向上し、知識的対立QAタスクでは最大2.9倍の向上を達成した。これは、モデルの誤ったバイアス(幻覚)を効果的に是正した結果である。
Language models (LMs) often struggle to pay enough attention to the input context, and generate texts that are unfaithful or contain hallucinations. To mitigate this issue, we present context-aware decoding (CAD), which follows a contrastive output distribution that amplifies the difference between the output probabilities when a model is used with and without context. Our experiments show that CAD, without additional training, significantly improves the faithfulness of different LM families, including OPT, GPT, LLaMA and FLAN-T5 for summarization tasks (e.g., 14.3% gain for LLaMA in factuality metrics). Furthermore, CAD is particularly effective in overriding a model's prior knowledge when it contradicts the provided context, leading to substantial improvements in tasks where resolving the knowledge conflict is essential.
研究の動機と目的
- 入力文脈に十分に注目できない言語モデル(LM)の問題、特に事前の知識と矛盾する場合の対処。
- パrametricな知識ではなく文脈的証拠に重きを置くようにモデルの挙動をシフトさせ、生成における幻覚を低減すること。
- 再訓練やアーキテクチャの変更なしに、市販の非微調整LMに適用可能な手法の開発。
- 要約や知識的対立の解消といった文脈に依存するタスクにおけるパフォーランスの向上。
提案手法
- CADは、文脈ありとなしの確率の差を強調する対照的定式化を用いて出力確率分布を修正する。
- ハイパーパramータ α を用いた温度に類似したスケーリングにより、ロジットを再重み付けする:softmax[(1+α)logit_with_context − α·logit_without_context]。
- 文脈と次のトークンの間のポイントワイズ相互情報量(PMI)を活用して、文脈的に関連する出力を同定する。
- 事前の知識のみで高い確率になる出力を低下させ、文脈が存在する場合にのみ確率が上昇する出力を優遇する。
- 推論時のみに適用され、モデルの微調整やアーキテクチャ変更を必要としない。
- OPT、GPT、LLaMA、FLAN-T5 といったさまざまなLMファミリーに普遍的に適用可能であるように設計されている。

実験結果
リサーチクエスチョン
- RQ1微調整なしに、言語モデルの入力文脈への忠実性をデコード手法で向上させられるか?
- RQ2提供された文脈と矛盾する場合に、対照的デコード戦略がモデルの事前の知識をどれほど効果的に上書きできるか?
- RQ3文脈に依存するタスク、特に知識的対立のシナリオにおいて、文脈に応じたデコードの有効性はモデルサイズに比例するか?
- RQ4文脈への注目と生成品質のバランスをとる最適な調整パrameter α は何か?
- RQ5この手法は、要約やQAのような多様なタスクおよびさまざまなLMアーキテクチャに一般化可能か?
主な発見
- LLaMA-30B における CNN-DM 要約タスクで、事実性指標が14.3%の絶対値向上を達成した。
- 知識的対立QAデータセットでは、標準的デコードと比較してCADが2.9倍のパフォーマンス向上を示した。
- CADによるパフォーマンス向上はモデルサイズに比例し、特に知識的対立タスクで顕著であった。これは、大きなモデルが事前の知識に強く依存していることを示唆している。
- α = 0.5 に設定すると、すべてのデータセットとモデルサイズで一貫した向上が得られ、特に対立が強いタスクではより高いα値がさらなる向上をもたらした。
- LLaMA-30B に適用した場合、ROUGE-Lスコアが21%向上し、事実性および構造的整合性の両面で優れた性能を示した。
- OPT、GPT、LLaMA、FLAN-T5 といった多様なLMファミリーにわたり、本手法の有効性が確認され、広範な適用可能性が裏付けられた。

より良い研究を、今すぐ始めましょう
論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。
クレジットカード登録不要
このレビューはAIが作成し、人間の編集者が確認しました。