Skip to main content
QUICK REVIEW

[论文解读] In Defense of Cross-Encoders for Zero-Shot Retrieval

Guilherme J. M. Rosa, Luiz Bonifacio|arXiv (Cornell University)|Dec 12, 2022
Domain Adaptation and Few-Shot Learning被引用 6
一句话总结

本文为交叉编码器在零样本检索中优于双编码器提供了辩护,表明具有早期查询-文档交互机制和更高参数量的更大交叉编码器在跨域任务中具有显著更好的泛化能力。研究显示,交叉编码器在BEIR基准上比最先进双编码器高出超过4个平均点,且在后续使用交叉编码器重排序时,第一阶段密集检索相较于BM25并无优势。

ABSTRACT

Bi-encoders and cross-encoders are widely used in many state-of-the-art retrieval pipelines. In this work we study the generalization ability of these two types of architectures on a wide range of parameter count on both in-domain and out-of-domain scenarios. We find that the number of parameters and early query-document interactions of cross-encoders play a significant role in the generalization ability of retrieval models. Our experiments show that increasing model size results in marginal gains on in-domain test sets, but much larger gains in new domains never seen during fine-tuning. Furthermore, we show that cross-encoders largely outperform bi-encoders of similar size in several tasks. In the BEIR benchmark, our largest cross-encoder surpasses a state-of-the-art bi-encoder by more than 4 average points. Finally, we show that using bi-encoders as first-stage retrievers provides no gains in comparison to a simpler retriever such as BM25 on out-of-domain tasks. The code is available at https://github.com/guilhermemr04/scaling-zero-shot-retrieval.git

研究动机与目标

  • 评估跨不同模型规模和领域,交叉编码器与双编码器在零样本泛化性能方面的表现。
  • 探究模型规模增大是否能提升在域外检索场景下的泛化能力。
  • 评估在后续使用交叉编码器重排序时,双编码器作为第一阶段检索器是否相比BM25等简单方法具有优势。
  • 确定早期查询-文档交互机制和隐藏维度扩展在交叉编码器泛化能力中的作用。

提出的方法

  • 在BEIR基准上,对从6000万到58亿参数的广泛模型规模的交叉编码器和双编码器进行训练与评估。
  • 使用基于monoT5的交叉编码器作为重排序器,并与GTR和SGPT等双编码器在22项检索任务中进行比较。
  • 在未进行微调的情况下,评估其在域外数据集(如TREC-COVID、Natural Questions和FEVER)上的零样本有效性。
  • 比较使用BM25与GTR-3.35亿参数作为第一阶段检索方法,随后使用monoT5-2.2亿参数进行重排序,以评估初始检索质量的影响。
  • 分析隐藏维度扩展(如从768扩展到4096)在参数量增加时对模型泛化的影响。
  • 使用nDCG@10和MRR@10在多样化领域中衡量性能,其中MS MARCO除外,该数据集使用MRR@10。

实验结果

研究问题

  • RQ1在不同领域中,模型规模如何影响交叉编码器与双编码器的零样本泛化能力?
  • RQ2与双编码器相比,交叉编码器中早期查询-文档交互是否有助于提升域外性能?
  • RQ3在后续使用交叉编码器重排序时,密集检索器(双编码器)是否能在多阶段检索流程中超越稀疏方法(如BM25)?
  • RQ4对于交叉编码器而言,模型规模增大是否仅在域内带来边际收益,而在域外泛化方面带来显著提升?
  • RQ5随着模型规模增大,隐藏维度扩展在多大程度上能提升交叉编码器的零样本有效性?

主要发现

  • 模型规模增大在域内仅带来边际收益,但在域外泛化方面,交叉编码器表现出显著提升。
  • 参数量最大的交叉编码器(58亿参数)在BEIR基准上比最先进双编码器高出超过4个平均点。
  • 具有早期查询-文档交互机制和更高隐藏维度(如4096)的交叉编码器,其零样本性能显著优于固定768维的模型。
  • 在后续使用交叉编码器重排序时,使用GTR等双编码器作为第一阶段检索器,并未带来性能优势,与BM25相当。
  • 无论初始检索方法为何,交叉编码器的有效性均保持较高水平,表明在多阶段流程中,重排序质量是主导因素。
  • 在所有测试领域(包括法律、医学和科学文本)中,交叉编码器均优于同等规模的双编码器,证实其更强的泛化能力。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。