[论文解读] RetGen: A Joint framework for Retrieval and Grounded Text Generation Modeling
RetGen 提出了一种联合框架,通过语言模型信号实现文档检索器与基于外部文档的文本生成器的端到端联合训练,无需昂贵的平行训练数据。通过互信息最大化协同优化检索与生成,RetGen 提升了文本生成的事实一致性与相关性,在对话与文本补全任务的人工评估中达到人类水平表现。
Recent advances in large-scale pre-training such as GPT-3 allow seemingly high quality text to be generated from a given prompt. However, such generation systems often suffer from problems of hallucinated facts, and are not inherently designed to incorporate useful external information. Grounded generation models appear to offer remedies, but their training typically relies on rarely-available parallel data where information-relevant documents are provided for context. We propose a framework that alleviates this data constraint by jointly training a grounded generator and document retriever on the language model signal. The model learns to reward retrieval of the documents with the highest utility in generation, and attentively combines them using a Mixture-of-Experts (MoE) ensemble to generate follow-on text. We demonstrate that both generator and retriever can take advantage of this joint training and work synergistically to produce more informative and relevant text in both prose and dialogue generation.
研究动机与目标
- 为解决大语言模型中幻觉性事实的问题,通过外部文档对生成内容进行约束。
- 减少对稀缺平行数据(如文档-回复对)的依赖,以训练基于文档的生成器。
- 利用语言模型信号联合优化检索器与生成器,以提升文本生成的事实准确性与相关性。
- 实现检索与生成组件的端到端联合训练,使其相互协同增强。
- 在对话与文本补全任务上评估该框架,证明其在连贯性、信息量和类人质量方面的提升。
提出的方法
- 使用语言模型信号联合训练密集段落检索器与多文档基于文档的生成器,避免对黄金平行数据的依赖。
- 采用专家混合(Mixture-of-Experts, MoE)机制,在解码过程中关注并融合来自多篇检索文档的信息。
- 利用语言模型的生成信号优化检索器,奖励那些能提升生成质量的文档检索。
- 应用互信息最大化(MMI)以增强检索文档与生成文本之间的对齐。
- 冻结生成器,单独微调检索器,使用召回率@10与期望奖励指标评估检索性能。
- 使用自动指标(如 BLEU、ROUGE)与人工评估综合衡量生成质量与检索有效性。
实验结果
研究问题
- RQ1联合训练框架是否能在无需平行训练数据的情况下同时提升检索与生成质量?
- RQ2利用语言模型信号优化检索,如何提升生成文本的事实一致性?
- RQ3与单文档或非注意力机制方法相比,基于 MoE 的多篇文档融合在多大程度上提升了生成质量?
- RQ4联合训练是否优于单独训练生成器与检索器?
- RQ5该模型能否在文本生成中达到人类水平表现,特别是在对话与开放式文本补全任务中?
主要发现
- 采用 MMI 的 RetGen 在人工评估中,连贯性偏好度达 40.5%,优于基线模型(vanilla RetGen 为 33.1%)及其他基线方法。
- 在 Reddit 数据集上的人工评估显示,RetGen 在连贯性方面优于人类回复 33.7% 的情况,信息量方面为 38.9%,人类文本相似度为 27.5%。
- 在 arXiv 数据集上,仅训练检索器阶段,期望奖励指标持续提升,表明检索器通过语言模型信号学习到了更相关文档的检索能力。
- 随着每批次训练样本数量增加,检索性能提升,但将检索文档数 K 从 4 增加到 8 时,召回率@10 仅获得微小增益。
- 与仅训练生成器的方法相比,联合训练框架在自动指标(如 BLEU、ROUGE)上表现更优,证明了联合优化的优势。
- 在 Reddit 数据集上,检索器的召回率@10 随训练过程稳步提升,证实语言模型信号能有效引导检索过程。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。