[论文解读] Leveraging Passage Retrieval with Generative Models for Open Domain Question Answering
本文提出了一种用于开放域问答的检索增强生成方法,其中序列到序列模型基于问题和多个检索到的维基百科段落生成答案。该方法在NaturalQuestions和TriviaQA数据集上取得了最先进性能,且随着检索段落数量的增加,性能显著提升,证明了生成模型在整合多段落证据方面的有效性。
Generative models for open domain question answering have proven to be competitive, without resorting to external knowledge. While promising, this approach requires to use models with billions of parameters, which are expensive to train and query. In this paper, we investigate how much these models can benefit from retrieving text passages, potentially containing evidence. We obtain state-of-the-art results on the Natural Questions and TriviaQA open benchmarks. Interestingly, we observe that the performance of this method significantly improves when increasing the number of retrieved passages. This is evidence that generative models are good at aggregating and combining evidence from multiple passages.
研究动机与目标
- 探究大型生成模型在开放域问答中是否能通过段落检索从外部知识中获益。
- 通过引入外部检索,解决训练和查询千亿参数模型带来的高计算成本问题。
- 评估序列到序列模型在结合多个检索段落证据方面的有效性。
- 在标准基准上,对比检索增强生成模型与抽取式和闭卷生成基线模型的性能。
提出的方法
- 根据数据集不同,使用BM25或密集检索(DPR)从维基百科中检索最多100个段落。
- 使用微调后的基于T5的序列到序列模型,基于问题和检索到的段落生成答案。
- 将段落截断为250个词元,并作为输入标记连接后输入生成模型。
- 使用Adam优化器进行微调,学习率恒定为10^-4,Dropout率为10%,训练10,000步,批量大小为64。
- 推理时使用贪婪解码生成答案,并通过小写化、去除标点符号和多余空白字符对结果进行归一化。
- 在NaturalQuestions、TriviaQA和SQuAD上评估该方法,并对训练和推理时的段落数量进行消融研究。
实验结果
研究问题
- RQ1生成模型在开放域问答中是否能通过从维基百科检索外部证据来实现更优性能?
- RQ2检索段落数量如何影响生成模型在多段落问答中的性能?
- RQ3与抽取式模型相比,融合多个检索段落是否能实现更优的证据聚合?
- RQ4通过仅用较少段落进行训练并在100个段落上微调,是否能降低计算成本同时保持高准确率?
- RQ5在准确率和可扩展性方面,检索增强生成建模与闭卷生成模型和抽取式方法相比如何?
主要发现
- Fusion-in-Decoder方法在NaturalQuestions开发集上实现了最先进46.5%的精确匹配(Exact Match),优于抽取式和闭卷生成模型。
- 在TriviaQA上,该方法达到64.7%的精确匹配,显示出在具有挑战性的开放域基准上的强大性能。
- 当检索段落数量从10增加到100时,TriviaQA的性能提升6个百分点,NaturalQuestions的性能提升3.5个百分点。
- 通过仅用25个段落进行训练并在100个段落上微调,将GPU训练时间从425小时减少至147小时,同时在NaturalQuestions上保持46.0%的EM。
- 随着段落数量增加,模型性能持续提升,表明其在多段落证据聚合方面具有强大能力,而抽取式模型在10–20个段落时即达到平台期。
- 该检索增强方法在仅使用770M参数和维基百科检索的情况下,在NaturalQuestions上实现了44.1%的EM,而110亿参数的闭卷T5模型仅实现36.6%的EM,表明外部记忆比参数扩展更高效。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。