[论文解读] Offline Comparison of Ranking Functions using Randomized Data
本文提出 Trunc-match 和 Rand-interleaving 两种方法,通过使用均匀随机化的历史交互数据,在离线评估排序函数时提升数据效率和比较敏感度。通过截断排序列表并利用交错法同时比较两个模型,这些方法在查询保留率和统计功效方面显著优于传统的 Direct-match 方法,其中 Rand-interleaving 在检测性能差异方面表现出最高的敏感度。
Ranking functions return ranked lists of items, and users often interact with these items. How to evaluate ranking functions using historical interaction logs, also known as off-policy evaluation, is an important but challenging problem. The commonly used Inverse Propensity Scores (IPS) approaches work better for the single item case, but suffer from extremely low data efficiency for the ranked list case. In this paper, we study how to improve the data efficiency of IPS approaches in the offline comparison setting. We propose two approaches Trunc-match and Rand-interleaving for offline comparison using uniformly randomized data. We show that these methods can improve the data efficiency and also the comparison sensitivity based on one of the largest email search engines.
研究动机与目标
- 为解决在排序列表离线评估中逆倾向得分(IPS)方法数据效率低下的问题,尤其是在因组合爆炸而无法匹配完整列表的情况下。
- 通过利用仅需成对比较(哪个模型更好)而非点对点指标估计的事实,提升离线评估中的数据效率和比较敏感度。
- 将交错法的应用从以往仅用于在线 A/B 测试扩展到使用均匀随机化数据的离线评估。
- 证明通过定制化的匹配与交错策略,可以更有效地利用随机化数据进行离线比较。
提出的方法
- Trunc-match 通过将记录的排序列表截断为前 k 项并仅比较这些项,提升匹配效率,从而增加新排序器输出的前 k 项与之匹配的概率。
- 该方法假设截断均匀随机化列表后仍保持均匀随机性,从而可在截断子集上实现无偏评估。
- Rand-interleaving 通过在每个位置取两个竞争排序器的最小排名来构建交错列表,从而实现对同一查询下两个模型相对性能的直接比较。
- 该方法利用交错列表估计点击通过率,将交错视为一种成对比较形式,从而提升敏感度。
- 两种方法均应用于包含 1.03M 查询的大规模电子邮件搜索引擎数据集,通过重采样计算置信区间并评估统计显著性。
- 评估将 Trunc-match 和 Rand-interleaving 与基线 Direct-match 进行对比,测量保留率、平均倒数排名(MRR@k)以及带误差棒的点击次数。
实验结果
研究问题
- RQ1截断随机化的排序列表是否能提升排序函数离线评估中的数据效率?
- RQ2在单个随机化列表中交错两个排序函数是否能相比单模型匹配提升比较敏感度?
- RQ3Trunc-match 和 Rand-interleaving 在查询保留率和检测性能差异的统计功效方面与 Direct-match 相比如何?
- RQ4是否可以有效利用随机化数据进行离线比较,而无需完整列表匹配或点对点指标估计?
主要发现
- Trunc-match 对于给定的 k,大约能保留 1/k! 的查询,与理论预期一致,且显著优于 Direct-match 的低保留率。
- 由于在每个位置匹配到两个模型中至少一个的前 k 项的概率更高,Rand-interleaving 保留的查询略多于 Trunc-match。
- Direct-match 即使在 k=1 时也显示出重叠的误差棒,表明其数据效率低下且比较的统计功效弱。
- Trunc-match 在保留率和比较敏感度方面均优于 Direct-match,但 Rand-interleaving 在平均值和标准误方面实现了两个排序器之间最佳的分离。
- 结果证实,交错法不仅通过增加数据使用量提升敏感度,更从根本上增强了检测性能差异的能力。
- 所提出的方法在包含 1.03M 查询的真实电子邮件搜索场景中表现有效,证明了其在大规模离线评估中的实际应用价值。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。