[論文レビュー] RetGen: A Joint framework for Retrieval and Grounded Text Generation Modeling
RetGenは、言語モデルの信号を用いて文書検索器と根拠付きテキスト生成器をエンドツーエンドで同時に学習する共同フレームワークを提案する。並列学習データの必要性を排除することで、高価なデータ収集を回避する。相互情報量の最大化による検索と生成の相乗効果的最適化により、生成テキストの事実的整合性と関連性が向上し、対話およびテキスト補完タスクにおける人間評価で人間水準の性能を達成する。
Recent advances in large-scale pre-training such as GPT-3 allow seemingly high quality text to be generated from a given prompt. However, such generation systems often suffer from problems of hallucinated facts, and are not inherently designed to incorporate useful external information. Grounded generation models appear to offer remedies, but their training typically relies on rarely-available parallel data where information-relevant documents are provided for context. We propose a framework that alleviates this data constraint by jointly training a grounded generator and document retriever on the language model signal. The model learns to reward retrieval of the documents with the highest utility in generation, and attentively combines them using a Mixture-of-Experts (MoE) ensemble to generate follow-on text. We demonstrate that both generator and retriever can take advantage of this joint training and work synergistically to produce more informative and relevant text in both prose and dialogue generation.
研究の動機と目的
- 大規模言語モデルにおける事実の捏造問題に対処するため、生成を外部文書に根拠づける。
- 根拠付き生成器の学習にあまり利用できない並列データ(例:文書-応答ペア)への依存を減らす。
- 言語モデルの信号を用いて検索器と生成器を共同で最適化し、テキスト生成における事実の正確性と関連性を向上させる。
- 相互に補い合う検索と生成のコンポONENTをエンドツーエンドで学習可能にする。
- 対話およびテキスト補完タスクにおいてフレームワークを評価し、一貫性、情報量、人間らしさの向上を示す。
提案手法
- 並列データに依存しない言語モデル信号を用いて、密度型のパラグラフ検索器と複数文書に根拠づいた生成器を共同で学習する。
- デコード段階で複数の検索済み文書からの情報を注意機構を用いて統合するMixture-of-Experts(MoE)機構を採用する。
- 生成品質を向上させる文書の検索を奨励することで、言語モデルの生成信号を用いて検索器を最適化する。
- 検索済み文書と生成テキストの整合性を向上させるために、相互情報量の最大化(MMI)を適用する。
- 生成器を固定し、検索器を別個に微調整することで、検索性能を再現率@10および期待報酬指標を用いて評価する。
- 自動評価指標(例:BLEU、ROUGE)と人間評価を用いて、生成品質および検索効果性を評価する。
実験結果
リサーチクエスチョン
- RQ1並列学習データを必要としない共同学習フレームワークは、検索と生成の両方の品質を向上させ得るか?
- RQ2検索の最適化に言語モデルの信号を用いることで、生成テキストの事実的整合性はどのように向上するか?
- RQ3複数の検索済み文書をMoEベースで統合する手法は、単一文書または非注目型手法に比べて、生成品質をどの程度向上させるか?
- RQ4共同学習は、生成器と検索器を別々に学習する場合に比べて、より優れた性能を発揮するか?
- RQ5モデルは、特に対話およびオープンエンドドテキスト補完タスクにおいて、人間水準の生成品質を達成できるか?
主な発見
- MMIを用いたRetGenは、人間評価で一貫性について40.5%の好まれ具合を示し、ヴァニラ版RetGen(33.1%)および他のベースラインを上回った。
- Redditデータセットにおいて、人間評価では、一貫性について33.7%、情報量について38.9%、人間との類似性について27.5%の割合でRetGenが人間の応答よりも好まれた。
- arXivデータセットでは、検索器専用の学習中に期待報酬指標が向上し、言語モデルの信号を用いて検索器がより関連性の高い文書を検索できるようになったことが示された。
- バッチあたりの学習例数を増やすことで検索性能が向上したが、検索文書数(K)を4から8に増やしても、再現率@10にはわずかな向上しか得られなかった。
- 共同学習フレームワークは、生成器専用の学習に比べて、自動評価指標(例:BLEU、ROUGE)が向上しており、共同最適化の利点を示している。
- Redditにおける検索器の性能(再現率@10)は、学習過程で着実に向上した。言語モデルの信号が検索を効果的に誘導していることが確認された。
より良い研究を、今すぐ始めましょう
論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。
クレジットカード登録不要
このレビューはAIが作成し、人間の編集者が確認しました。