Skip to main content
QUICK REVIEW

[论文解读] Zero-shot Neural Passage Retrieval via Domain-targeted Synthetic Question Generation

Ji Ma, Ivan Korotkov|arXiv (Cornell University)|Apr 29, 2020
Topic Modeling参考文献 59被引用 6
一句话总结

本文提出一种零样本神经段落检索方法,通过领域定向的合成问题生成,克服对大规模监督训练语料的依赖。通过在通用领域数据上微调预训练问题生成模型,并将其应用于目标领域文档,该方法可大规模生成大量、噪声但具有领域特异性的问题-段落配对用于训练。关键贡献在于结合BM25与合成神经检索器的混合模型,其性能接近监督模型,尤其在科学文献等专业领域表现突出。

ABSTRACT

A major obstacle to the wide-spread adoption of neural retrieval models is that they require large supervised training sets to surpass traditional term-based techniques, which are constructed from raw corpora. In this paper, we propose an approach to zero-shot learning for passage retrieval that uses synthetic question generation to close this gap. The question generation system is trained on general domain data, but is applied to documents in the targeted domain. This allows us to create arbitrarily large, yet noisy, question-passage relevance pairs that are domain specific. Furthermore, when this is coupled with a simple hybrid term-neural model, first-stage retrieval performance can be improved further. Empirically, we show that this is an effective strategy for building neural passage retrieval models in the absence of large training corpora. Depending on the domain, this technique can even approach the accuracy of supervised models.

研究动机与目标

  • 解决在专业领域中缺乏大规模标注训练数据时,训练高性能神经段落检索模型的挑战。
  • 克服通用领域预训练模型在科学文献、旅游论坛和科技社区等专业领域中迁移能力差的问题。
  • 开发一种可扩展的数据增强策略,用于生成用于零样本训练的合成问题-段落相关性配对。
  • 通过结合基于词项的(BM25)与神经检索的混合模型,提升第一阶段检索性能。
  • 证明零样本模型在真实世界领域中可接近监督模型的性能,尤其在结合混合评分策略时。

提出的方法

  • 在通用领域的问题-答案对(如SQuAD或社区平台数据)上微调预训练问题生成模型。
  • 将训练好的问题生成器应用于目标领域文档,大规模生成合成问题-段落配对。
  • 使用合成的、具有领域特异性的问题-段落配对作为弱监督信号,训练神经段落检索模型。
  • 通过插值其向量表示,构建结合BM25与神经检索器的混合检索模型,用于相似度打分。
  • 使用近似最近邻(ANN)搜索,基于混合模型的向量得分高效检索top-k段落。
  • 在BioASQ、NaturalQuestions及特定领域数据集等目标领域基准上,使用标准信息检索指标(MAP、P@10、nDCG@10)评估模型性能。

实验结果

研究问题

  • RQ1能否通过通用领域预训练模型生成的合成问题,有效适应专业领域以实现零样本段落检索?
  • RQ2在科学文献或旅游论坛等专业领域中,零样本神经检索器的性能与监督基线相比如何?
  • RQ3在无标注数据的情况下,将BM25与神经检索器结合,能在多大程度上提升检索准确率?
  • RQ4需要多少合成训练数据才能达到最优性能?模型是否能超越记忆化而实现泛化?
  • RQ5检索性能对问题生成器质量的敏感度如何?更大的生成器是否能带来更好的结果?

主要发现

  • 所提出的合成问题生成方法在三个专业领域(科学文献、旅游、科技论坛)和一个通用领域中,显著提升了零样本段落检索性能。
  • 混合BM25 + 神经模型(QGenHyb)在BioASQ7上的MAP达到39.3,优于BM25(36.3)和纯神经模型QGen(28.4)。
  • 在BioASQ8文档检索任务中,QGenHyb模型的MAP达到39.2,接近监督模型的性能(例如,QGenHyb经重排序后为40.4)。
  • 性能在仅使用目标语料库20%的数据进行合成查询生成时趋于稳定,表明模型具备泛化能力而非记忆化,覆盖了21%的参考段落。
  • 更大的问题生成器可提升生成质量(Rouge分数),但对检索性能影响甚微,表明领域特定数据量比生成器规模更为关键。
  • 在NaturalQuestions中,由于BM25性能较弱,零样本与监督模型之间的差距扩大,表明零样本性能具有数据和领域依赖性。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。