Skip to main content
QUICK REVIEW

[論文レビュー] Joint Retrieval and Generation Training for Grounded Text Generation.

Yizhe Zhang, Siqi Sun|arXiv (Cornell University)|May 14, 2021
Topic Modeling参考文献 41被引用数 10
ひとこと要約

本論文は、並列な検索・生成データを必要とせず、根拠に基づいたテキスト生成を可能にする共同検索・生成トレーニングフレームワークを提案する。言語モデルの信号を用いてMixture-of-Expertsアンサンブルを介して検索器と生成器を共同で学習することで、モデルは、有用性を最大化する文書を検索し、事実に基づいた、文脈的に関連性のあるテキストを、プローゼおよび対話タスクの両方で生成する能力を習得する。

ABSTRACT

Recent advances in large-scale pre-training such as GPT-3 allow seemingly high quality text to be generated from a given prompt. However, such generation systems often suffer from problems of hallucinated facts, and are not inherently designed to incorporate useful external information. Grounded generation models appear to offer remedies, but their training typically relies on rarely-available parallel data where corresponding information-relevant documents are provided for context. We propose a framework that alleviates this data constraint by jointly training a grounded generator and document retriever on the language model signal. The model learns to reward retrieval of the documents with the highest utility in generation, and attentively combines them using a Mixture-of-Experts (MoE) ensemble to generate follow-on text. We demonstrate that both generator and retriever can take advantage of this joint training and work synergistically to produce more informative and relevant text in both prose and dialogue generation.

研究の動機と目的

  • 根拠に基づいた生成モデルのトレーニングにおける並列な検索・生成データの欠如に対処すること。
  • 生成中に外部知識の検索を統合することで、大規模言語モデルにおける幻覚を低減すること。
  • 自己回帰的言語モデル信号のみを用いて、検索器と生成器の協調的トレーニングを可能にすること。
  • 検索と生成のコンポONENTを共同最適化することで、生成テキストの事実の整合性と関連性を向上させること。
  • 本フレームワークが、オープンエンドなプローゼおよび対話生成タスクの両方で有効であることを示すこと。

提案手法

  • 本フレームワークは、並列な検索・生成アノテーションが不要な自己回帰的言語モデルの目的関数のみを用いて、検索器と生成器を共同でトレーニングする。
  • 検索器は、真値生成の尤度を最大化する文書を検索するように学習され、言語モデルの信号を有用性の代理指標として用いる。
  • 生成器は、複数の検索済み文書を動的に参照・統合するためのMixture-of-Experts(MoE)アーキテクチャを採用する。
  • マスクド言語モデルを通じて、同時に検索と生成を最適化する、統一された目的関数を用いる。
  • 本フレームワークにより、エンドツーエンドのトレーニングが可能となり、検索の質が生成のなめらかさと事実の正確性を直接向上させる。
  • 本手法は、言語モデルの自己回帰的容量を活用して、弱い対応や並列データに依存せずに、検索を暗黙的に監視する。

実験結果

リサーチクエスチョン

  • RQ1並列な検索・生成データが存在しない状況でも、根拠に基づいた生成モデルを効果的にトレーニングできるか?
  • RQ2検索と生成の共同トレーニングは、生成テキストの事実の整合性と関連性をどのように向上させるか?
  • RQ3言語モデルの信号のみで、生成に適した効果的な文書検索をどれほど効果的に誘導できるか?
  • RQ4Mixture-of-Expertsアーキテクチャは、検索済み文書の統合をどのように向上させるか?
  • RQ5共同フレームワークは、プローゼや対話など多様な生成タスクに一般化可能か?

主な発見

  • 共同トレーニングフレームワークは、ベースラインモデルと比較して、生成テキストの事実の整合性と関連性を顕著に向上させる。
  • 検索器は、明示的な監視や並列データがなくても、生成に有用な文書を特定する能力を習得する。
  • 生成器は検索済み文書の恩恵を受けて、より情報量が多く、文脈的に正確な出力を生成する。
  • Mixture-of-Experts機構により、生成中に複数の検索済み文書を効果的かつ動的に統合できる。
  • モデルは、オープンエンドなテキスト生成および対話タスクの両方で優れたパフォーマンスを達成し、ドメインをまたいで一般化できることを示した。
  • 本フレームワークは、並列トレーニングデータがなくても、生成を検索された証拠に基づかせることで、幻覚を低減する。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。