Skip to main content
QUICK REVIEW

[论文解读] Predicting User Preferences

Pavel Sirotkin|arXiv (Cornell University)|Mar 15, 2011
Web Data Mining and Analysis参考文献 12被引用 3
一句话总结

本文提出了一种新度量方法,用于评估检索指标在搜索结果中预测实际用户偏好的能力。利用该度量方法,研究发现:折损累计收益(DCG)在预测用户偏好方面优于平均平均精度(MAP)和经典精确率;出人意料的是,增加结果数量反而会降低指标的预测能力。

ABSTRACT

The many metrics employed for the evaluation of search engine results have not themselves been conclusively evaluated. We propose a new measure for a metric's ability to identify user preference of result lists. Using this measure, we evaluate the metrics Discounted Cumulated Gain, Mean Average Precision and classical precision, finding that the former performs best. We also show that considering more results for a given query can impair rather than improve a metric's ability to predict user preferences.

研究动机与目标

  • 为现有搜索评估指标缺乏明确的评估方法提供解决方案。
  • 提出一种新度量方法,以定量评估某一指标预测实际用户偏好的能力。
  • 比较广泛使用的指标(DCG、MAP和经典精确率)的预测性能。
  • 研究结果列表长度对指标预测用户偏好能力的影响。

提出的方法

  • 提出一种新颖度量方法,基于用户行为数据评估指标预测用户偏好的能力。
  • 使用真实用户偏好数据校准并验证所提出的度量方法。
  • 将该度量方法应用于评估三种标准指标:折损累计收益(DCG)、平均平均精度(MAP)和经典精确率。
  • 系统性地改变每次查询所考虑的结果数量,以评估其对预测性能的影响。
  • 使用统计分析比较不同列表长度下各指标的预测准确性。
  • 使用真实世界搜索评估环境中的实证数据验证研究发现。

实验结果

研究问题

  • RQ1标准检索指标在多大程度上能预测搜索结果中的实际用户偏好?
  • RQ2在DCG、MAP和经典精确率中,哪一指标最能准确预测用户偏好?
  • RQ3增加结果列表中的结果数量,会提高还是削弱指标预测用户偏好的能力?
  • RQ4为最大化指标的预测能力,最优列表长度是多少?

主要发现

  • 折损累计收益(DCG)在所评估指标中表现出最高的预测性能。
  • 平均平均精度(MAP)在预测用户偏好方面表现不如DCG。
  • 经典精确率在所测试的三种指标中预测能力最弱。
  • 增加结果列表中的结果数量会降低所有指标的预测能力,这与普遍直觉相反。
  • 研究发现,更长的结果列表会削弱指标预测用户偏好的能力,表明在某一列表长度之后,收益递减。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。