Skip to main content
QUICK REVIEW

[论文解读] Measuring "Why" in Recommender Systems: a Comprehensive Survey on the Evaluation of Explainable Recommendation

Xu Chen, Yongfeng Zhang|arXiv (Cornell University)|Feb 14, 2022
Recommender Systems and Techniques被引用 12
一句话总结

本文对可解释推荐系统的评估进行了全面综述,按视角(有效性、透明度、说服力、可审查性)和方法(案例研究、定量指标、众包、在线实验)对评估方法进行分类。文章系统性地比较了各类方法,识别其优缺点,并根据应用场景和预算限制,为选择评估策略提供了实用指南。

ABSTRACT

Explainable recommendation has shown its great advantages for improving recommendation persuasiveness, user satisfaction, system transparency, among others. A fundamental problem of explainable recommendation is how to evaluate the explanations. In the past few years, various evaluation strategies have been proposed. However, they are scattered in different papers, and there lacks a systematic and detailed comparison between them. To bridge this gap, in this paper, we comprehensively review the previous work, and provide different taxonomies for them according to the evaluation perspectives and evaluation methods. Beyond summarizing the previous work, we also analyze the (dis)advantages of existing evaluation methods and provide a series of guidelines on how to select them. The contents of this survey are based on more than 100 papers from top-tier conferences like IJCAI, AAAI, TheWebConf, Recsys, UMAP, and IUI, and their complete summarization are presented at https://shimo.im/sheets/VKrpYTcwVH6KXgdy/MODOC/. With this survey, we finally aim to provide a clear and comprehensive review on the evaluation of explainable recommendation.

研究动机与目标

  • 为解决推荐系统中解释评估缺乏系统性比较和标准化的问题。
  • 识别并分类可解释推荐研究中使用的主要评估视角——有效性、透明度、说服力和可审查性。
  • 分析并比较四种主要评估方法:案例研究、定量指标、众包和在线实验。
  • 基于应用场景、预算和利益相关者需求,提供选择合适评估方法的实用指南。
  • 指出研究空白与未来方向,包括与任务无关的评估以及针对复杂利益相关者效用的自动化指标学习。

提出的方法

  • 提出可解释推荐中评估视角的分类体系,包括解释有效性、透明度、说服力和可审查性。
  • 将评估方法划分为四类:案例研究、定量指标、众包和在线实验,每类具有不同的实施方式和应用场景。
  • 分析各类方法的优势与局限,例如众包成本较高,而案例研究在测量主观用户效用方面可靠性较低。
  • 基于100余篇顶级会议论文的洞察,从成本、可扩展性、人工参与度和可靠性等维度比较各类方法。
  • 提出基于预算、系统关键性(如医疗与电商对比)和模型成熟度等因素的方法选择实用指南。
  • 提出未来研究方向,包括从人工标注数据中学习指标函数,以及构建大规模基准数据集,包含多视角真实标注,用于有效性、说服力等以人为中心的指标。

实验结果

研究问题

  • RQ1评估推荐系统中解释的关键评估视角有哪些?它们在关注点上如何不同?
  • RQ2在可靠性、成本和适用性方面,不同评估方法(案例研究、定量指标、众包、在线实验)如何比较?
  • RQ3在实际可解释推荐系统中应用时,各类评估方法的优势与局限是什么?
  • RQ4研究人员和实践者如何根据系统上下文、预算和利益相关者需求选择最合适的评估方法?
  • RQ5为提升可解释推荐研究评估的标准化与鲁棒性,未来需要哪些研究方向?

主要发现

  • 综述识别出四个核心评估视角:解释有效性、透明度、说服力和可审查性,每类均需采用定制化的评估策略。
  • 众包是捕捉人类感知最直接的方法,但成本较高;而案例研究成本低,但在测量主观用户效用方面可靠性较低。
  • 定量指标具有可重复性,但可能无法捕捉复杂的人类偏好,尤其是基于启发式设计的指标。
  • 在线实验通过测量真实用户行为(如点击率、转化率)提供高可靠性,但存在干扰生产系统的风险,且部署成本高。
  • 没有单一评估方法在所有情况下都最优;最佳方案通常结合多种方法——例如,早期阶段使用案例研究进行调试,最终验证阶段使用定量指标。
  • 综述指出了一个关键研究空白:缺乏大规模、多视角的基准数据集,且未为有效性、说服力等以人为中心的指标提供真实标注。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。