[论文解读] Large Dual Encoders Are Generalizable Retrievers
本文提出通用的基于T5的密集检索器(GTR),这是一系列具有固定768维瓶颈层的大规模双编码器模型,通过在20亿个社区问答对上进行多阶段预训练,并在MS MARCO上微调,实现了训练。尽管采用固定的点积相似度,但将模型规模从基础版扩展到XXL版(参数量达50亿)显著提升了在BEIR上的零样本跨域泛化性能,GTR-XXL在MS MARCO上实现了最先进性能,并展现出10%的数据效率。
It has been shown that dual encoders trained on one domain often fail to generalize to other domains for retrieval tasks. One widespread belief is that the bottleneck layer of a dual encoder, where the final score is simply a dot-product between a query vector and a passage vector, is too limited to make dual encoders an effective retrieval model for out-of-domain generalization. In this paper, we challenge this belief by scaling up the size of the dual encoder model {\em while keeping the bottleneck embedding size fixed.} With multi-stage training, surprisingly, scaling up the model size brings significant improvement on a variety of retrieval tasks, especially for out-of-domain generalization. Experimental results show that our dual encoders, extbf{G}eneralizable extbf{T}5-based dense extbf{R}etrievers (GTR), outperform %ColBERT~\cite{khattab2020colbert} and existing sparse and dense retrievers on the BEIR dataset~\cite{thakur2021beir} significantly. Most surprisingly, our ablation study finds that GTR is very data efficient, as it only needs 10\% of MS Marco supervised data to achieve the best out-of-domain performance. All the GTR models are released at https://tfhub.dev/google/collections/gtr/1.
研究动机与目标
- 挑战一种广泛持有的观点,即由于固定瓶颈层的存在,双编码器在跨域泛化方面存在局限。
- 探究在保持瓶颈维数固定的前提下,扩大双编码器模型规模是否能提升检索性能与泛化能力。
- 评估在社区问答数据上进行大规模预训练,并在精选数据集上微调,对提升零样本泛化能力的有效性。
- 评估在人类标注训练数据方面的数据效率,特别是使用更少的MS MARCO数据是否仍能实现最优的跨域性能。
提出的方法
- 采用T5模型的仅编码器架构,将参数量从2.5亿扩展至50亿,同时保持瓶颈维数固定为768。
- 执行多阶段训练:首先在约20亿个社区问答对上进行预训练,然后在MS MARCO上进行微调以实现密集检索。
- 在双编码器设置中,查询和文档编码器之间共享参数,以提升参数效率和泛化能力。
- 使用查询和段落嵌入之间的简单点积相似度作为最终打分函数,不引入额外的交互层。
- 在涵盖9个领域的18项任务上,对BEIR基准进行零样本性能评估,排除MS MARCO。
- 开展消融研究,分析预训练、微调以及数据效率对跨域性能的影响。
实验结果
研究问题
- RQ1在保持瓶颈维数固定的前提下,扩大双编码器模型规模是否能提升其在多样化检索领域中的零样本泛化性能?
- RQ2通过多阶段预训练和微调训练的大规模双编码器是否能在跨域任务中超越现有的稀疏和密集检索器?
- RQ3该模型在人类标注训练数据方面的效率如何,特别是当仅使用10%的MS MARCO数据时?
- RQ4大规模双编码器的性能更多依赖于模型容量,还是依赖于如多向量或交互层等架构创新?
主要发现
- GTR-XXL在BEIR基准上实现了最先进性能,在18项检索任务中均优于现有的稀疏和密集检索器。
- 扩大模型规模能持续提升跨域泛化能力,最大模型在零样本评估中表现出最显著的性能提升。
- 消融研究显示,GTR仅需10%的MS MARCO训练数据即可实现最佳跨域性能,展现出极高的数据效率。
- 最大的GTR-XXL模型检索的文档平均长度是GTR-Base的两倍,这可能解释了其在Web-Touche2020等长文档检索任务中的优异表现。
- 尽管采用固定的点积相似度,大规模双编码器的性能仍超越了采用更复杂交互机制的模型,挑战了关于架构必要性的既有假设。
- 推理延迟从GTR-Base的17ms增至GTR-XXL的349ms,但仍处于重排序模型的可接受范围内,表明可通过蒸馏或稀疏化技术进一步优化。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。