[论文解读] Learning Diverse Document Representations with Deep Query Interactions for Dense Retrieval
本文提出了一种双交叉编码器模型,通过为每个文档生成多个伪查询,并利用文档与这些查询的交互来学习多样化、与查询相关的文档表征。该方法在保持双编码器推理效率的同时实现了交叉编码器级别的性能,在 MS MARCO、TREC DL 19 和 TREC DL 20 基准测试中均优于强基线模型。
In this paper, we propose a new dense retrieval model which learns diverse document representations with deep query interactions. Our model encodes each document with a set of generated pseudo-queries to get query-informed, multi-view document representations. It not only enjoys high inference efficiency like the vanilla dual-encoder models, but also enables deep query-document interactions in document encoding and provides multi-faceted representations to better match different queries. Experiments on several benchmarks demonstrate the effectiveness of the proposed method, out-performing strong dual encoder baselines.The code is available at \url{https://github.com/jordane95/dual-cross-encoder
研究动机与目标
- 在不牺牲推理效率的前提下,弥合交叉编码器与双编码器模型在密集检索中的性能差距。
- 通过在编码过程中引入深层查询-文档交互,提升文档表征的多样性。
- 实现多维度的文档表征,使其更好地匹配不同查询的语义。
- 探索伪查询生成作为数据增强和表征学习策略的有效性。
提出的方法
- 对于每个文档,查询生成模型会生成多个伪查询,作为交互提示。
- 通过将文档与生成的查询拼接,并采用交叉编码器架构对每个文档进行编码,从而生成与查询相关的多视角表征。
- 最终的文档表征通过在所有与查询相关的表征上进行最大池化获得,以保留多样性并支持高效的向量搜索。
- 模型使用对比学习结合难负样本优化表征空间,提升零样本泛化能力。
- 通过在查询编码器和文档编码器之间共享参数,减少模型参数量,同时保持性能。
- 该方法与最大内积搜索(MIPS)兼容,支持对预计算文档向量的高效推理。
实验结果
研究问题
- RQ1是否可以预先计算深层查询-文档交互,以实现交叉编码器级别的性能,同时保持双编码器的推理效率?
- RQ2查询的多样性与质量如何影响多视角文档编码中的检索性能?
- RQ3伪查询生成能否有效增强训练数据并提升表征质量?
- RQ4多视角文档编码是否能提升对多样化查询的匹配准确率?
主要发现
- 在 MS MARCO 上,该模型相比 DPR 双编码器基线模型在 MRR@10 上提升了 2.8(36.0 vs. 34.2),在 TREC DL 20 上 nDCG@10 提升了 5.6(68.9 vs. 63.3)。
- 在 TREC DL 20 上,该模型在 nDCG@10 上超越 ColBERT,同时计算成本更低。
- 即使不使用数据增强,该模型在 TREC DL 19 基准测试中的性能也与使用数据增强的 DPR 相当。
- 消融实验表明,基于生成查询进行预训练可提升微调性能,但直接在真实数据上微调效果更优。
- 参数共享略微降低了性能,表明异构编码对建模查询-文档交互更为有利。
- 该模型仅需每篇文档生成 4–6 个伪查询即可实现良好的性能,兼顾了多样性与效率。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。