Skip to main content
QUICK REVIEW

[论文解读] Data Requirements for Evaluation of Personalization of Information Retrieval - A Position Paper

Nicholas J. Belkin, Daniel Hienert|arXiv (Cornell University)|Sep 7, 2018
Information Retrieval and Search Behavior参考文献 21被引用 4
一句话总结

本文立场论文主张,评估信息检索中的个性化效果需将搜索会话视为整体单元,并考虑用户目标与意图的动态演变。论文提出,全面的用户行为、系统交互及会话级意图转变数据对于有效评估至关重要,提出了一个模型与数据需求框架,以支持对个性化信息检索系统进行有意义的评估。

ABSTRACT

Two key, but usually ignored, issues for the evaluation of methods of personalization for information retrieval are: that such evaluation must be of a search session as a whole; and, that people, during the course of an information search session, engage in a variety of activities, intended to accomplish differ- ent goals or intentions. Taking serious account of these factors has major impli- cations for not only evaluation methods and metrics, but also for the nature of the data that is necessary both for understanding and modeling information search, and for evaluation of personalized support for information retrieval (IR). In this position paper, we: present a model of IR demonstrating why these fac- tors are important; identify some implications of accepting their validity; and, on the basis of a series of studies in interactive IR, identify some types of data concerning searcher and system behavior that we claim are, at least, necessary, if not necessarily sufficient, for meaningful evaluation of personalization of IR.

研究动机与目标

  • 解决当前个性化信息检索(IR)评估框架缺乏系统性、未能涵盖完整搜索会话的问题。
  • 强调用户在搜索会话中进行多项目标导向活动,而当前评估方法常忽略这一点。
  • 主张必须采用会话级评估,因为个性化会影响用户在多个查询与交互中的行为。
  • 识别出用于建模用户意图、行为及系统响应在整个搜索会话中演变所需的具体数据类型。
  • 通过定义最小但必要的数据需求,为未来个性化IR的评估奠定基础。

提出的方法

  • 提出一种信息检索模型,将搜索视为一系列目标导向活动,而非孤立的查询。
  • 强调需捕捉单一会话内多次交互中的用户行为,而不仅限于单个查询-响应对。
  • 识别关键数据类型:用户行为(点击、停留时间、查询重构)、系统响应(相关性判断、排序结果)以及会话级意图转变。
  • 利用互动式信息检索研究的发现,论证会话级数据与行为追踪的必要性。
  • 倡导整合时间与上下文用户行为的评估框架,而非仅依赖静态相关性评分。
  • 呼吁建立标准化的数据采集实践,以支持对用户意图演变的建模。

实验结果

研究问题

  • RQ1若忽略会话级行为与意图转变,个性化信息检索如何才能实现有意义的评估?
  • RQ2哪些用户与系统行为数据是捕捉IR中个性化全貌所必需的?
  • RQ3为何仅基于孤立查询或相关性判断来评估个性化是不充分的?
  • RQ4需要何种数据结构与元数据,才能对搜索会话中用户目标的演变进行建模?
  • RQ5评估指标应如何重新定义,以反映用户搜索行为的整体性与个性化效果?

主要发现

  • 由于用户行为具有动态与目标导向的特性,个性化IR的评估必须考虑整个搜索会话,而非单个查询。
  • 用户在会话中进行多项不同活动——如探索、精炼与确认——每项活动均有其特定目标。
  • 会话级意图转变显著影响个性化评估方式,需记录用户目标随时间的变化。
  • 当前评估实践常无法捕捉查询重构、点击模式与停留时间等行为动态,而这些对个性化评估至关重要。
  • 本文识别出特定数据类型——如用户行为、系统响应与意图转换——为有效评估所必需,即使其本身并不充分。
  • 若缺乏全面的会话级数据,IR中个性化评估可能产生误导或不完整的结果,特别是在衡量长期用户满意度或有效性时。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。