Skip to main content
QUICK REVIEW

[论文解读] A Thorough Examination on Zero-shot Dense Retrieval

Ruiyang Ren, Yingqi Qu|arXiv (Cornell University)|Apr 27, 2022
Multimodal Machine Learning Applications被引用 6
一句话总结

本文对使用预训练语言模型的零样本密集检索(DR)进行了全面的实证研究,分析了源训练数据特征(如查询与文档分布、词汇重叠度及数据规模)对跨领域性能的影响。研究发现,词汇重叠度和查询类型分布对零样本性能有显著影响;在高重叠数据集上,整合稀疏检索(如BM25)可显著提升DR结果,而更大的源数据规模虽能提升泛化能力,但过大的文档规模反而可能损害性能。

ABSTRACT

Recent years have witnessed the significant advance in dense retrieval (DR) based on powerful pre-trained language models (PLM). DR models have achieved excellent performance in several benchmark datasets, while they are shown to be not as competitive as traditional sparse retrieval models (e.g., BM25) in a zero-shot retrieval setting. However, in the related literature, there still lacks a detailed and comprehensive study on zero-shot retrieval. In this paper, we present the first thorough examination of the zero-shot capability of DR models. We aim to identify the key factors and analyze how they affect zero-shot retrieval performance. In particular, we discuss the effect of several key factors related to source training set, analyze the potential bias from the target dataset, and review and compare existing zero-shot DR models. Our findings provide important evidence to better understand and develop zero-shot DR models.

研究动机与目标

  • 识别并分析影响不同领域中零样本密集检索性能的关键因素。
  • 研究源训练集特征(如查询与文档分布、数据规模及词汇重叠度)对零样本泛化的影响。
  • 评估目标数据集偏差(尤其是词汇重叠)对DR与BM25等稀疏模型相对性能的影响。
  • 系统比较现有零样本DR方法,并识别提升零样本泛化能力的有效技术。
  • 为设计更稳健、更具泛化能力的零样本DR模型提供可操作的见解。

提出的方法

  • 在三个基准数据集(BioASQ、SciFact、FiQA)上对多个在不同源领域微调的DR模型进行广泛的实证评估。
  • 系统性地改变源训练集的组成部分:查询集、文档集及数据规模,以隔离其对零样本性能的影响。
  • 分析源域与目标域之间查询类型分布及词汇重叠度对检索效果的影响。
  • 评估最先进的零样本DR方法(包括Contriever、GTR、GPL和LaPraDoR),并对比其与BM25分数集成前后的表现。
  • 在所有实验中使用NDCG@10作为主要评估指标,以确保一致比较。
  • 在训练中应用知识蒸馏和对比学习技术,以生成高质量的伪标签数据,用于零样本适应。

实验结果

研究问题

  • RQ1源训练集的构成与规模(查询、文档、数据量)如何影响零样本DR性能?
  • RQ2源域与目标域之间的词汇重叠度在多大程度上影响零样本检索效果?
  • RQ3源数据中查询类型分布如何影响模型泛化到未见目标领域的能力?
  • RQ4为何在某些零样本设置中BM25会优于DR模型?这是否源于数据集偏差?
  • RQ5哪些技术(如集成BM25或使用对比预训练)最有效地提升零样本DR性能?

主要发现

  • 源训练集的质量与构成——尤其是查询集与文档集——对零样本DR性能有显著影响。
  • 源域与目标域之间的词汇重叠度是影响零样本性能的关键因素,重叠度越高,通常结果越好。
  • 源数据中查询类型分布影响泛化能力,因在多样化查询类型上训练的模型能更好地泛化到未见领域。
  • 增加源查询集规模可同时提升域内与域外性能,而增加文档集规模可能导致性能下降。
  • 将BM25分数集成到DR模型中(如通过LaPraDoR)在词汇重叠度高的数据集(如BioASQ、SciFact)上可带来显著性能提升,但在低重叠数据集(如FiQA)上收益甚微。
  • 在某些基准中观察到BM25优于DR,可能源于数据集偏差(如标注中依赖精确词汇匹配),而非模型本身的优势。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。