[论文解读] Parameter-Efficient Prompt Tuning Makes Generalized and Calibrated Neural Text Retrievers
本文提出了一种参数高效的提示调优方法(具体为 P-Tuning v2),用于神经文本检索器,在仅使用模型参数的 0.1% 的情况下,实现了与全量微调相当的性能。该方法在域外和跨主题泛化方面表现出显著提升,归因于更优的置信度校准和对查询长度的鲁棒性,并构建并发布了目前最大的主题特定学术检索数据集 OAG-QA,包含 18,000 组查询-论文对,覆盖 87 个主题。
Prompt tuning attempts to update few task-specific parameters in pre-trained models. It has achieved comparable performance to fine-tuning of the full parameter set on both language understanding and generation tasks. In this work, we study the problem of prompt tuning for neural text retrievers. We introduce parameter-efficient prompt tuning for text retrieval across in-domain, cross-domain, and cross-topic settings. Through an extensive analysis, we show that the strategy can mitigate the two issues -- parameter-inefficiency and weak generalizability -- faced by fine-tuning based retrieval methods. Notably, it can significantly improve the out-of-domain zero-shot generalization of the retrieval models. By updating only 0.1% of the model parameters, the prompt tuning strategy can help retrieval models achieve better generalization performance than traditional methods in which all parameters are updated. Finally, to facilitate research on retrievers' cross-topic generalizability, we curate and release an academic retrieval dataset with 18K query-results pairs in 87 topics, making it the largest topic-specific one to date.
研究动机与目标
- 解决神经文本检索中全量微调存在的参数效率低下与泛化能力差的问题。
- 探究参数高效的提示调优是否能提升在域内、跨域及跨主题设置下的泛化能力。
- 理解提示调优在检索任务中实现泛化能力提升的内在机制,特别是置信度校准与查询长度鲁棒性。
- 构建并发布一个大规模、细粒度的学术检索数据集(OAG-QA),以支持未来对跨主题泛化能力的研究。
提出的方法
- 将 P-Tuning v2 这一参数高效的提示调优方法应用于神经文本检索器,仅微调一小部分可学习的提示嵌入,同时冻结预训练检索器中的其余所有参数。
- 引入可微分的提示嵌入层,插入到预训练模型的输入之前,仅对这些提示 token 进行梯度更新。
- 在域内和域外数据集上,使用对比学习目标(如 InfoNCE)训练检索器,用提示调优替代全量微调。
- 使用标准检索指标(如 MRR、Recall@k)评估模型性能,并通过在域内和跨域基准上计算期望校准误差(ECE)来评估校准性能。
- 通过分析不同查询长度区间(如短、中、长)下的性能表现,开展关于查询长度鲁棒性的消融研究。
- 整理并发布 OAG-QA,一个全新的学术检索数据集,包含 17,948 组查询-论文对,覆盖 87 个主题和 22 个学科领域,以支持跨主题评估。
实验结果
研究问题
- RQ1参数高效的提示调优是否能在神经文本检索中实现与全量微调相当的域内性能?
- RQ2与全量微调相比,提示调优是否能提升对域外和跨主题检索基准的零样本泛化能力?
- RQ3提示调优在检索任务中实现泛化能力提升的内在机制是什么?
- RQ4提示调优如何影响模型的校准性能以及对不同查询长度的鲁棒性?
- RQ5鉴于其极高的参数效率,提示调优在检索任务中支持少样本和元学习场景的程度如何?
主要发现
- P-Tuning v2 在仅更新模型参数 0.1% 的情况下,实现了与全量微调相当的域内性能。
- 在 BEIR 基准上,P-Tuning v2 在域外设置下相对于微调模型实现了 3.5% 至 105.0% 的相对 MRR 提升。
- 无论在域内还是跨域数据集上,P-Tuning v2 模型的置信度校准性能均显著优于微调模型,这一结果通过期望校准误差(ECE)度量得到验证。
- P-Tuning v2 在应对查询长度变化方面表现出更强的鲁棒性,在短查询(Quora)和长查询(ArguAna)上均优于微调模型。
- OAG-QA 数据集包含 17,948 组查询-论文对,覆盖 87 个主题和 22 个学科领域,是迄今为止发布规模最大的细粒度主题特定学术检索数据集。
- 实证分析证实,改进的校准性能与查询长度鲁棒性是提示调优在检索任务中实现泛化优势的关键驱动因素。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。