[论文解读] WebBrain: Learning to Generate Factually Correct Articles for Queries by Grounding on Large Web Corpus
本文提出了 WebBrain,这是一种新颖的 NLP 任务,通过基于大规模网络语料库中的证据来生成事实正确、类似维基百科的文章,以回答事实性查询。作者提出了 ReGen 框架,通过改进的证据检索、引用感知生成以及面向事实的预训练,提升了事实正确性,在新构建的、规模大十倍的数据集 WebBrain-Raw 上,自动评估与人工评估均达到了最先进性能。
In this paper, we introduce a new NLP task -- generating short factual articles with references for queries by mining supporting evidence from the Web. In this task, called WebBrain, the ultimate goal is to generate a fluent, informative, and factually-correct short article (e.g., a Wikipedia article) for a factual query unseen in Wikipedia. To enable experiments on WebBrain, we construct a large-scale dataset WebBrain-Raw by extracting English Wikipedia articles and their crawlable Wikipedia references. WebBrain-Raw is ten times larger than the previous biggest peer dataset, which can greatly benefit the research community. From WebBrain-Raw, we construct two task-specific datasets: WebBrain-R and WebBrain-G, which are used to train in-domain retriever and generator, respectively. Besides, we empirically analyze the performances of the current state-of-the-art NLP techniques on WebBrain and introduce a new framework ReGen, which enhances the generation factualness by improved evidence retrieval and task-specific pre-training for generation. Experiment results show that ReGen outperforms all baselines in both automatic and human evaluations.
研究动机与目标
- 为解决在未见的事实性查询上,通过外部网络证据进行事实正确、信息丰富的文章生成挑战。
- 通过依赖可检索、可引用的证据而非内部知识,克服大语言模型中的幻觉问题。
- 通过构建 WebBrain-Raw 数据集(规模为先前同类数据集的十倍),建立大规模事实性文章生成基准。
- 评估当前 SOTA 模型在生成带引用的事实性内容方面的局限性,并提出一种能提升事实一致性和覆盖度的解决方案。
提出的方法
- 通过提取所有英文维基百科文章及其对应参考文章,构建 WebBrain-Raw,形成该任务目前最大的公开可用数据集。
- 衍生出两个特定任务的数据集:用于训练领域内检索器的 WebBrain-R 和用于训练事实感知生成器的 WebBrain-G。
- 设计 ReGen,一种统一框架,通过主题一致的证据检索、生成过程中的显式引用标记以及面向事实的自监督目标进行任务特定预训练,提升事实正确性。
- 实施一种预热策略,通过使用 BART 和 FiD 的蒸馏设置,对生成器进行微调,以弥合预训练与下游任务分布之间的差距。
- 集成检索增强生成流水线,其中检索器选择相关证据,生成器同时基于查询和检索到的参考文献进行条件生成。
- 采用多阶段训练流程:首先在事实导向任务上预训练生成器,然后使用检索到的证据和引用监督进行微调。
实验结果
研究问题
- RQ1当以事实性查询提示时,现有大语言模型是否能在不依赖外部证据的情况下生成事实正确、类似维基百科的文章?
- RQ2与纯参数化生成相比,基于检索到的网络证据进行生成,如何提升事实一致性和覆盖度?
- RQ3引用感知生成和改进的证据检索在多大程度上提升了文章生成的事实正确性?
- RQ4面向事实的预训练和预热策略是否能显著提升事实感知生成器在 WebBrain 任务上的性能?
- RQ5训练数据规模(WebBrain-Raw)如何影响生成文章的泛化能力和事实质量?
主要发现
- ReGen(大模型)在所有自动评估指标上均取得最高分,包括 BLEU-1(28.94)、METEOR(14.87)、ROUGE-L(21.27)、CIDEr(19.30)、QAGS(48.72)和 TripleScore(12.56),优于 GPT-3 和其他基线模型。
- ReGen 框架显著提升了事实正确性,TripleScore 达 12.56,表明与真实事实的对齐更好,幻觉现象更少。
- 人工评估确认,与 GPT-3 和其他基线相比,ReGen 生成的文章更具流畅性、信息量和事实准确性,尤其在提供参考文献时表现更优。
- 在生成过程中使用引用标记,改善了来源归属,帮助模型更好地将主张与证据关联,从而减少事实性错误。
- 密集检索(DPR)的召回率高于精确率,表明尽管其捕获了更多内容,但也引入了更多噪声——这表明结合多个检索器可进一步提升性能。
- 预热策略显著缩小了预训练与微调之间的性能差距,实现了更好的句子-参考文献匹配,提升了事实覆盖度。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。