Skip to main content
QUICK REVIEW

[论文解读] An Axiomatic Analysis of Diversity Evaluation Metrics: Introducing the Rank-Biased Utility Metric

Enrique Amigó, Damiano Spina|arXiv (Cornell University)|May 7, 2018
Information Retrieval and Search Behavior参考文献 25被引用 7
一句话总结

本文提出了排名偏差效用(RBU),一种用于搜索结果多样化评估的新度量指标,该指标满足相关性与多样性的全面公理化约束。RBU在改进的排名偏差精确度框架中整合了用户努力与冗余因素,相较于现有度量指标,在标准测试集合中表现出更优的一致性,能够捕捉更广泛的品质标准,且无需事先了解具体场景细节。

ABSTRACT

Many evaluation metrics have been defined to evaluate the effectiveness ad-hoc retrieval and search result diversification systems. However, it is often unclear which evaluation metric should be used to analyze the performance of retrieval systems given a specific task. Axiomatic analysis is an informative mechanism to understand the fundamentals of metrics and their suitability for particular scenarios. In this paper, we define a constraint-based axiomatic framework to study the suitability of existing metrics in search result diversification scenarios. The analysis informed the definition of Rank-Biased Utility (RBU) -- an adaptation of the well-known Rank-Biased Precision metric -- that takes into account redundancy and the user effort associated to the inspection of documents in the ranking. Our experiments over standard diversity evaluation campaigns show that the proposed metric captures quality criteria reflected by different metrics, being suitable in the absence of knowledge about particular features of the scenario under study.

研究动机与目标

  • 通过形式化的公理化框架,识别用于评估搜索结果多样化系统的基本品质标准。
  • 基于涵盖相关性、多样性、冗余性和用户努力的十个正式约束,分析现有多样性度量指标。
  • 识别当前度量指标中未能同时满足所有期望约束的缺陷。
  • 提出一种新度量指标——排名偏差效用(RBU),使其满足所有提出的约束。
  • 通过标准评估活动验证RBU在捕捉多样化品质维度方面的优越性。

提出的方法

  • 定义一个基于约束的公理化框架,包含十个正式公理,涵盖相关性、多样性、冗余性和用户努力。
  • 通过引入用户努力参数 e 和冗余处理机制,对排名偏差精确度进行改进,构建RBU。
  • 形式化证明RBU满足全部十个公理,确保其与基本评估原则一致。
  • 通过可配置参数 p(重要性衰减)和 e(努力成本)实现RBU,以模拟用户检查行为。
  • 在TREC Web和Dynamic Domain赛道上,使用平均效用(MU)作为元评估度量,将RBU与官方度量指标进行对比评估。
  • 使用MU评估不同度量指标间的一致性,衡量RBU在排名质量判断上与其他度量指标的一致频率。

实验结果

研究问题

  • RQ1哪些正式约束是评估搜索结果多样化系统有效性所必需的?
  • RQ2现有多样性评估度量指标是否满足所有提出的公理?
  • RQ3能否构建一个单一度量指标,使其满足所有公理并同时捕捉多样化的品质方面?
  • RQ4在不同测试集合中,RBU与官方度量指标在共识和一致性方面表现如何?
  • RQ5用户努力参数 e 在多大程度上影响RBU的性能与鲁棒性?

主要发现

  • 现有任何多样性度量指标均未满足全部十个提出的公理,揭示了当前评估实践中存在的关键缺陷。
  • RBU满足全部十个公理,使其在无需事先了解系统行为的前提下,理论基础坚实,适用于多样化检索场景。
  • 在TREC Web Track实验中,当截断点 k=20 时,RBU的平均效用(MU)得分为 0.9556,高于所有官方度量指标。
  • 当努力参数 e 设为零时,RBU仍优于所有其他度量指标,证实其在不依赖努力建模的情况下依然具备鲁棒性。
  • 在TREC Dynamic Domain 2015赛道中,RBU变体在MU得分上位居首位,表明其在不同交互式搜索场景中均表现出一致的优越性。
  • RBU在多个测试集合中实现了统一的评估决策,表明其捕捉的品质标准范围广于现有度量指标。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。