Skip to main content
QUICK REVIEW

[论文解读] DPTDR: Deep Prompt Tuning for Dense Passage Retrieval

Zhengyang Tang, Benyou Wang|arXiv (Cornell University)|Aug 24, 2022
Topic Modeling被引用 4
一句话总结

本文提出DPTDR,一种用于密集段落检索的深度提示微调方法,通过引入检索导向的中间预训练(RIP)和统一负样本挖掘(UNM),在MS-MARCO和Natural Questions数据集上实现了最先进性能。这些策略使提示微调能够达到微调性能,同时通过参数高效微调显著降低部署成本。

ABSTRACT

Deep prompt tuning (DPT) has gained great success in most natural language processing~(NLP) tasks. However, it is not well-investigated in dense retrieval where fine-tuning~(FT) still dominates. When deploying multiple retrieval tasks using the same backbone model~(e.g., RoBERTa), FT-based methods are unfriendly in terms of deployment cost: each new retrieval model needs to repeatedly deploy the backbone model without reuse. To reduce the deployment cost in such a scenario, this work investigates applying DPT in dense retrieval. The challenge is that directly applying DPT in dense retrieval largely underperforms FT methods. To compensate for the performance drop, we propose two model-agnostic and task-agnostic strategies for DPT-based retrievers, namely retrieval-oriented intermediate pretraining and unified negative mining, as a general approach that could be compatible with any pre-trained language model and retrieval task. The experimental results show that the proposed method (called DPTDR) outperforms previous state-of-the-art models on both MS-MARCO and Natural Questions. We also conduct ablation studies to examine the effectiveness of each strategy in DPTDR. We believe this work facilitates the industry, as it saves enormous efforts and costs of deployment and increases the utility of computing resources. Our code is available at https://github.com/tangzhy/DPTDR.

研究动机与目标

  • 为解决在多任务密集检索场景中,每个任务都需要独立的主干模型副本所带来的高部署成本问题。
  • 探究深度提示微调(DPT)是否能在密集段落检索中实现与微调(FT)相当的性能,尽管其在该设置下通常存在性能下降。
  • 开发模型无关和任务无关的策略,以在不修改模型架构的前提下提升DPT在密集检索中的性能。
  • 通过利用轻量级可训练提示,实现仅使用一个冻结主干模型来高效、可扩展地部署多个检索模型。

提出的方法

  • 提出检索导向的中间预训练(RIP),通过使用随机采样的句子或文本片段进行对比学习,对主干模型进行预训练,以在提示微调前提升表示质量。
  • 提出统一负样本挖掘(UNM),通过结合来自多种检索器(包括BM25和密集检索器)的难负样本,采用未去噪和去噪采样方法,以提升训练信号的多样性与难度。
  • 通过在预训练语言模型(如RoBERTa)的深层插入可训练提示向量,实现深度提示微调(DPT),冻结主干权重,仅微调提示参数。
  • 采用对比学习目标,对齐正样本段落对并使表示空间趋于均匀,通过损失分量 $l_{align}$ 和 $l_{uniform}$ 评估表示质量。
  • 使用重排序器对来自多个检索器的难负样本进行去噪,提升DPT训练中使用的负样本质量。
  • 支持任何预训练语言模型(PLM)且无需修改架构,实现DPT基检索器的即插即用式部署。

实验结果

研究问题

  • RQ1尽管深度提示微调(DPT)在该设置下通常表现不佳,它是否能在密集段落检索中实现与微调(FT)相当的性能?
  • RQ2检索导向的中间预训练(RIP)是否能通过提升文本表示质量,显著改善DPT在密集检索中的性能?
  • RQ3通过结合来自多个检索系统、多样且难的负样本,统一负样本挖掘(UNM)在多大程度上提升了DPT性能?
  • RQ4RIP和UNM带来的性能提升是否在不同预训练语言模型和检索基准上均具有鲁棒性?
  • RQ5DPT基模型是否能在保持低部署成本的同时,通过参数效率实现最先进性能?

主要发现

  • DPTDR在MS-MARCO和Natural Questions两个数据集上均优于先前最先进模型,分别取得MRR@10为38.7和35.5的性能。
  • RIP与UNM的结合使DPT性能达到全量微调水平,在MS-MARCO上相比基线DPT,MRR@10提升了3.2个百分点。
  • 使用随机采样句子进行RIP预训练,其零样本性能(MRR@10: 15.4)优于基于文本片段的采样(MRR@10: 11.1),表明句子级预训练更有利于保持语义完整性。
  • RIP在对齐性($l_{align}$)和均匀性($l_{uniform}$)上均优于coCondenser(一种经过精心修改、增加解码器结构的模型),表明架构修改可能并非必要。
  • 当结合未去噪的难负样本时,UNM使MRR@10提升1.5个百分点;若进一步引入去噪负样本,性能再提升0.4个百分点。
  • DPTDR对提示长度不敏感,在结合RIP时即使在零样本设置下也能实现优异性能,表明其具备强鲁棒性与泛化能力。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。