Skip to main content
QUICK REVIEW

[论文解读] Joint Retrieval and Generation Training for Grounded Text Generation.

Yizhe Zhang, Siqi Sun|arXiv (Cornell University)|May 14, 2021
Topic Modeling参考文献 41被引用 10
一句话总结

本文提出了一种联合检索与生成的训练框架,可在无需平行检索-生成数据的情况下实现基于事实的文本生成。通过利用语言模型信号,结合专家混合(Mixture-of-Experts)集成方法,联合训练检索器与生成器,模型学会检索能最大化实用性的文档,并在叙述和对话任务中生成事实准确、上下文相关的文本。

ABSTRACT

Recent advances in large-scale pre-training such as GPT-3 allow seemingly high quality text to be generated from a given prompt. However, such generation systems often suffer from problems of hallucinated facts, and are not inherently designed to incorporate useful external information. Grounded generation models appear to offer remedies, but their training typically relies on rarely-available parallel data where corresponding information-relevant documents are provided for context. We propose a framework that alleviates this data constraint by jointly training a grounded generator and document retriever on the language model signal. The model learns to reward retrieval of the documents with the highest utility in generation, and attentively combines them using a Mixture-of-Experts (MoE) ensemble to generate follow-on text. We demonstrate that both generator and retriever can take advantage of this joint training and work synergistically to produce more informative and relevant text in both prose and dialogue generation.

研究动机与目标

  • 解决训练基于事实的生成模型时缺乏平行检索-生成数据的问题。
  • 通过在生成过程中整合外部知识检索,减少大语言模型中的幻觉现象。
  • 仅使用自回归语言建模范式信号,实现检索器与生成器的协同训练。
  • 通过联合优化检索与生成模块,提升文本生成的事实一致性与相关性。
  • 在开放式叙述与对话生成任务中,验证该框架的有效性。

提出的方法

  • 该框架仅使用自回归语言建模范式联合训练检索器与生成器,消除了对平行检索-生成标注数据的需求。
  • 检索器通过语言模型信号作为效用代理,训练以检索能最大化真实生成结果似然性的文档。
  • 生成器采用专家混合(Mixture-of-Experts, MoE)架构,动态关注并整合多个检索到的文档进行生成。
  • 模型使用单一统一目标,通过掩码语言建模同时优化检索与生成过程。
  • 该框架支持端到端训练,检索质量可直接提升生成的流畅性与事实准确性。
  • 该方法利用语言模型的自回归能力隐式监督检索过程,避免依赖弱对齐或平行数据。

实验结果

研究问题

  • RQ1能否在无平行检索-生成数据的情况下,有效训练基于事实的生成模型?
  • RQ2检索与生成的联合训练在多大程度上提升了生成文本的事实一致性与相关性?
  • RQ3仅靠语言模型信号,能否有效引导生成任务中的文档检索?
  • RQ4专家混合架构是否增强了检索文档在生成过程中的整合效果?
  • RQ5该联合框架能否在叙述与对话等多样化生成任务中实现泛化?

主要发现

  • 与基线模型相比,联合训练框架显著提升了生成文本的事实一致性与相关性。
  • 检索器在无需显式监督或平行数据的情况下,学会了识别对生成具有高实用性的文档。
  • 生成器从检索到的文档中获益,生成了更具信息量且上下文更准确的输出。
  • 专家混合机制实现了对多个检索文档在生成过程中的有效且动态的整合。
  • 该模型在开放式文本生成与对话任务中均表现出色,展现出跨领域的泛化能力。
  • 该框架通过将生成过程基于检索到的证据,即使在无平行训练数据的情况下,也能有效减少幻觉现象。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。