[论文解读] Scaling Down, LiTting Up: Efficient Zero-Shot Listwise Reranking with Seq2seq Encoder-Decoder Models
本文提出了 LiT5-Distill 和 LiT5-Score,这两种基于 T5 编码器-解码器架构的高效零样本列表重排序模型,尽管参数量仅为 220M 到 3B,但性能达到当前最先进水平,可与大型 LLM 相媲美。通过从 RankGPT 模型蒸馏排序结果,并利用交叉注意力分数进行相关性评分,该方法在不依赖标注相关性数据的前提下,仍能在 MS MARCO 和 BEIR 基准上保持强大有效性。
Recent work in zero-shot listwise reranking using LLMs has achieved state-of-the-art results. However, these methods are not without drawbacks. The proposed methods rely on large LLMs with billions of parameters and limited context sizes. This paper introduces LiT5-Distill and LiT5-Score, two methods for efficient zero-shot listwise reranking, leveraging T5 sequence-to-sequence encoder-decoder models. Our approaches demonstrate competitive reranking effectiveness compared to recent state-of-the-art LLM rerankers with substantially smaller models. Through LiT5-Score, we also explore the use of cross-attention to calculate relevance scores to perform reranking, eliminating the reliance on external passage relevance labels for training. We present a range of models from 220M parameters to 3B parameters, all with strong reranking results, challenging the necessity of large-scale models for effective zero-shot reranking and opening avenues for more efficient listwise reranking solutions. We provide code and scripts to reproduce our results at https://github.com/castorini/LiT5.
研究动机与目标
- 开发高效、小规模的列表重排序模型,使其在不依赖大量参数的情况下,性能可与大型 LLM 相当。
- 探索将大型 LLM(如 RankGPT 3.5 和 4)的排序行为蒸馏到更小的 T5 基模型中的方法。
- 通过使用交叉注意力分数作为内在相关性信号,消除对外部段落相关性标注的依赖。
- 评估小型模型(220M–3B 参数)在多样化基准上的零样本重排序有效性。
- 研究编码器-解码器模型在列表重排序中的缩放行为,并评估大模型在数据有限时的过拟合风险。
提出的方法
- LiT5-Distill 使用知识蒸馏,将大型 LLM(RankGPT 3.5/4)的排序行为迁移至更小的 T5 基编码器-解码器模型。
- 该方法通过指令微调数据,对学生模型进行微调,使其预测与教师模型相同的排序顺序。
- LiT5-Score 利用 FiD 风格解码器中的交叉注意力分数,计算段落相关性,而无需依赖标注的相关性数据。
- 两种模型均采用序列到序列框架,输入为查询和段落列表,输出为重排序后的列表。
- 模型在由大型 LLM 生成的合成数据上进行训练,并在 MS MARCO 和 BEIR 等标准基准上进行评估。
- 训练采用两阶段微调:首先在完整段落列表上微调,然后在随机采样的段落子集上微调,以提升泛化能力。
实验结果
研究问题
- RQ1序列到序列的编码器-解码器模型能否被有效适配用于零样本列表重排序?
- RQ2大型 LLM 的重排序效果能否成功蒸馏到更小的 T5 基模型中?
- RQ3FiD 风格模型中的交叉注意力分数能否作为段落相关性的可靠、无标签度量,用于重排序?
- RQ4在零样本设置下,模型大小如何影响重排序效果?
- RQ5在有限数据上训练时,大模型是否会发生过拟合?如何缓解?
主要发现
- LiT5-Distill XL(3B 参数)在多个 MS MARCO 数据集上的表现优于当前最先进模型(如 RankGPT 4 和 RankZephyr),尽管参数量更少。
- LiT5-Distill 基础模型(220M 参数)在 DL19 上取得 0.689 的 nDCG@10 分数,在 DL20 上取得 0.662,表明其在极小参数量下仍具备强大性能。
- LiT5-Score XL(3B 参数)在 BEIR 数据集上表现优于较小版本,但在 MS MARCO 上若训练超过一个周期则表现下降。
- LiT5-Score 基础模型和大模型在 DL19 上分别取得 0.689 和 0.720 的 nDCG@10 分数,仅训练两个周期,表明其具有强大泛化能力。
- 当训练超过一个周期时,LiT5-Score XL 在 DL19 和 DL20 上均出现性能下降,表明存在过拟合现象。
- FiD 风格解码器中的交叉注意力分数提供了强有力的、无标签的相关性信号,使无需外部监督的高效零样本重排序成为可能。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。