[论文解读] Beyond Yes and No: Improving Zero-Shot LLM Rankers via Scoring Fine-Grained Relevance Labels
本文通过将零样本 LLM 排名器中的二元相关性提示(是/否)替换为细粒度的相关性标签(如‘高度相关’、‘部分相关’和‘不相关’),提出了一种增强方法。通过提示 LLM 为这些中间标签分配似然度,并将结果聚合为排序分数,该方法在 8 个 BEIR 数据集上显著提升了排序性能,使用五级评分标准时平均 NDCG@10 提升至 0.5022。
Zero-shot text rankers powered by recent LLMs achieve remarkable ranking performance by simply prompting. Existing prompts for pointwise LLM rankers mostly ask the model to choose from binary relevance labels like "Yes" and "No". However, the lack of intermediate relevance label options may cause the LLM to provide noisy or biased answers for documents that are partially relevant to the query. We propose to incorporate fine-grained relevance labels into the prompt for LLM rankers, enabling them to better differentiate among documents with different levels of relevance to the query and thus derive a more accurate ranking. We study two variants of the prompt template, coupled with different numbers of relevance levels. Our experiments on 8 BEIR data sets show that adding fine-grained relevance labels significantly improves the performance of LLM rankers.
研究动机与目标
- 为解决零样本 LLM 排名器中二元相关性提示的局限性,后者无法区分部分相关文档。
- 探究提供中间相关性标签是否能提升模型对文档相关性等级的区分能力。
- 评估不同相关性等级数量及标签格式(文本型 vs. 评分量表)对排序性能的影响。
- 比较不同策略在将 LLM 似然度聚合为最终排序分数时的表现。
提出的方法
- 使用多个相关性标签选项(如‘高度相关’、‘部分相关’和‘不相关’)代替二元的‘是’或‘否’来提示 LLM。
- 利用 LLM 对每个相关性标签的似然度分数,通过峰值似然度或期望相关性(边缘概率)计算最终排序分数。
- 评估两种提示变体:文本型细粒度标签(如 RG-3L)和评分量表提示(如 RG-S(0,4)),使用从 0 到 k 的整数量表。
- 将相关性等级上的似然度聚合,生成反映细微相关性判断的连续排序分数。
- 比较两种得分推导方法:峰值相关性似然度与基于边缘概率的期望相关性。
- 将该方法应用于 8 个 BEIR 基准数据集,使用标准信息检索指标(如 NDCG@10)评估性能。

实验结果
研究问题
- RQ1与二元‘是/否’提示相比,在 LLM 提示中引入中间相关性标签是否能提升零样本排序性能?
- RQ2相关性等级的数量如何影响 LLM 排名器的性能?
- RQ3文本标签(如‘部分相关’)还是评分量表提示(如 0–4)能产生更好的排序结果?
- RQ4在聚合 LLM 似然度时,峰值似然度法与期望相关性法,哪种能产生更优的排序分数?
- RQ5即使数据集中的真实标签为二元标签,细粒度提示是否仍能提升排序性能?
主要发现
- 使用三级文本相关性标签(RG-3L)将平均 NDCG@10 提升至 0.4992,而五级评分量表(RG-S(0,4))达到 0.5022,显著优于二元提示。
- 峰值似然度策略生成的排序分数与期望相关性方法非常接近,提供了计算效率更高的替代方案。
- 采用细粒度标签的模型能更好地区分高分文档,避免了二元提示中顶部文档得分趋同的‘平台效应’。
- 性能并未随标签数量增加而单调提升;RG-S(0,8) 和 RG-S(0,10) 的表现劣于 RG-S(0,4),表明存在最优的标签粒度。
- 即使在真实标签仅为二元的测试集上,性能提升依然存在,表明收益源于模型推理能力的增强,而非标签匹配。
- 期望相关性方法在大多数提示类型中持续优于峰值似然度,尽管后者在文本标签设置中仍具竞争力。

更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。