[论文解读] RankT5: Fine-Tuning T5 for Text Ranking with Ranking Losses
该论文提出RankT5,一种通过将T5的编码器-解码器和编码器-仅架构适配为直接输出数值排名分数,以微调T5用于文本排序的方法。通过使用成对损失和列表损失进行训练,而非分类损失,RankT5在MS MARCO和Natural Question数据集上实现了显著的性能提升,其中列表损失显著增强了对域外数据的零样本泛化能力。
Recently, substantial progress has been made in text ranking based on pretrained language models such as BERT. However, there are limited studies on how to leverage more powerful sequence-to-sequence models such as T5. Existing attempts usually formulate text ranking as classification and rely on postprocessing to obtain a ranked list. In this paper, we propose RankT5 and study two T5-based ranking model structures, an encoder-decoder and an encoder-only one, so that they not only can directly output ranking scores for each query-document pair, but also can be fine-tuned with "pairwise" or "listwise" ranking losses to optimize ranking performances. Our experiments show that the proposed models with ranking losses can achieve substantial ranking performance gains on different public text ranking data sets. Moreover, when fine-tuned with listwise ranking losses, the ranking model appears to have better zero-shot ranking performance on out-of-domain data sets compared to the model fine-tuned with classification losses.
研究动机与目标
- 为解决传统上依赖分类或标记生成的文本排序方法未能充分利用T5等强大序列到序列模型的问题。
- 使T5能够直接输出实值排名分数,而非离散标记,从而实现与排名特定目标端到端的优化。
- 探究使用排名损失(成对/列表)进行微调是否能提升模型在域内和零样本域外数据上的性能,相较于基于分类的微调。
- 评估在使用如Softmax等列表损失时,训练列表大小对模型性能的影响。
- 比较使用排名损失与点分类损失微调的模型在多样化、域外基准上的泛化能力。
提出的方法
- 提出两种RankT5模型变体:一种为编码器-解码器结构,通过生成一个分数标记输出;另一种为仅编码器结构,通过一个头部层回归到实值分数。
- 使用排名损失(具体为PointCE(点分类)、Softmax(列表)和成对损失)进行模型微调,而非标准的交叉熵分类损失。
- 将训练数据组织为包含一个正样本和多个负样本的查询-文档对列表,训练列表大小从5到36不等,以研究其影响。
- 推理时使用仅编码器变体,通过回归头部将[CLS]标记表示映射为连续排名分数。
- 在零样本评估中,将微调后的模型应用于BM25检索出的前1000篇文档的重排序,覆盖多样化的BEIR基准数据集。
- 使用标准T5微调流程优化模型,但损失函数设计为最大化NDCG等排名指标。
实验结果
研究问题
- RQ1通过输出连续排名分数而非离散标记,能否有效将T5适配用于文本排序?
- RQ2与点分类损失相比,使用列表损失(如Softmax)微调T5是否能带来更好的域内和零样本性能?
- RQ3在使用列表损失时,训练列表大小(每查询的文档数量)如何影响模型性能?
- RQ4与基于分类损失微调的模型相比,使用排名损失微调的模型是否在域外数据上具有更好的泛化能力?
- RQ5在低资源或零样本条件下,编码器-解码器与仅编码器RankT5架构之间是否存在性能差异?
主要发现
- 使用列表损失(尤其是Softmax损失)微调的RankT5模型在MS MARCO和Natural Question数据集上相较于基于分类的微调,实现了显著的性能提升。
- 在15个BEIR域外数据集上,Softmax损失相比PointCE损失平均提升了+2.1% NDCG@10,且具有统计显著性(p ≤ 0.05)。
- 在生物医学数据集(如TREC-COVID、BioASQ和NFCorpus)上,Softmax损失相比PointCE平均提升+4.6%,表明其具有更好的领域泛化能力。
- 随着训练列表大小增加,模型性能持续提升,在NQ上列表大小超过30后趋于饱和,而在MS MARCO上则在36时仍保持稳定上升趋势。
- 仅编码器RankT5变体配合回归头部实现了优异性能,并支持高效推理,适用于早期排序阶段。
- 使用列表损失进行微调的模型能更好地捕捉相关性的抽象概念,减少对语料库特定记忆的依赖。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。