[论文解读] Learning Dense Representations of Phrases at Scale
本文提出DensePhrases,一种利用阅读理解任务中的监督信号,通过新颖的负采样方法(包括预批处理负样本)和查询端微调,大规模学习短语密集向量表示的方法。该方法在开放域问答任务中达到最先进性能,与检索器-阅读器模型相当,同时将存储需求降低80%,并在CPU上实现每秒处理超过10个问题的高效推理。
Open-domain question answering can be reformulated as a phrase retrieval problem, without the need for processing documents on-demand during inference (Seo et al., 2019). However, current phrase retrieval models heavily depend on sparse representations and still underperform retriever-reader approaches. In this work, we show for the first time that we can learn dense representations of phrases alone that achieve much stronger performance in open-domain QA. We present an effective method to learn phrase representations from the supervision of reading comprehension tasks, coupled with novel negative sampling methods. We also propose a query-side fine-tuning strategy, which can support transfer learning and reduce the discrepancy between training and inference. On five popular open-domain QA datasets, our model DensePhrases improves over previous phrase retrieval models by 15%-25% absolute accuracy and matches the performance of state-of-the-art retriever-reader models. Our model is easy to parallelize due to pure dense representations and processes more than 10 questions per second on CPUs. Finally, we directly use our pre-indexed dense phrase representations for two slot filling tasks, showing the promise of utilizing DensePhrases as a dense knowledge base for downstream tasks.
研究动机与目标
- 开发一个完全基于密集表示的短语检索系统,消除对稀疏表示在开放域问答中的依赖。
- 通过利用阅读理解数据集的监督信号和数据增强,改进短语表示学习。
- 通过查询端微调减少训练与推理之间的分布偏移,提升泛化能力。
- 实现在CPU硬件上低存储、高吞吐量的高效、可扩展短语检索。
- 展示DensePhrases作为下游任务(如槽位填充)的密集知识库的实用性。
提出的方法
- 在阅读理解数据集的问答对上使用对比学习训练短语编码器,短语级表示从同一上下文提取。
- 应用数据增强和知识蒸馏,提升单篇文档内短语表示的质量。
- 引入预批处理负样本,利用前一批次的嵌入作为负样本,增强对比学习,而无需大规模批量训练。
- 将批内负样本作为负采样基线,提升正负短语之间的判别能力。
- 实施查询端微调,即在下游问答数据集上微调问题编码器,使问题表示与预先索引的短语表示对齐。
- 将维基百科的所有短语表示预先索引到密集向量数据库中,以实现在推理阶段的高效相似度搜索。
实验结果
研究问题
- RQ1完全基于密集的短语表示是否能在不依赖稀疏检索的情况下,在开放域问答中实现最先进性能?
- RQ2新颖的负采样策略(尤其是预批处理负样本)在大规模短语表示学习中的有效性如何?
- RQ3查询端微调在多大程度上减少了训练与推理之间的分布偏移,并提升了零样本泛化能力?
- RQ4DensePhrases能否作为下游任务(如槽位填充)的可行密集知识库,且仅需极少微调?
- RQ5在用密集短语表示替代稀疏表示时,模型性能、存储效率与推理速度之间的权衡如何?
主要发现
- DensePhrases在五个开放域问答基准(包括Natural Questions和SQuAD)上,相比先前的短语检索模型,绝对准确率提升15%–25%。
- 该模型性能与最先进检索器-阅读器模型(如DPR和REALM)相当,在Natural Questions上达到40.9%的EM,在SQuAD上达到38.0%。
- 由于消除了稀疏表示,完整英文维基百科的存储从1.5TB减少至320GB,降幅达79%。
- 该模型在CPU上每秒可处理超过10个问题,展现出极高的推理效率。
- 即使短语编码器未在这些数据集上训练过,查询端微调在分布外数据集(如TQA、WQ、TREC)上仍使性能提升15%–20%。
- 仅使用5%的训练数据进行微调,DensePhrases在两个槽位填充任务上即达到最先进结果,证明其作为密集知识库的可行性。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。