Skip to main content
QUICK REVIEW

[论文解读] GPT as a Baseline for Recommendation Explanation Texts

Joyce Zhou, Thorsten Joachims|arXiv (Cornell University)|Sep 16, 2023
Explainable Artificial Intelligence (XAI)Computer Science被引用 3
一句话总结

本研究在模拟推荐系统中评估了GPT生成的电影推荐文本解释与人工撰写评论的对比效果。参与者对已观看过的电影,认为模型生成的评论显著优于人工评论,表明大型语言模型(LLM)可作为个性化、信息丰富且具有说服力的推荐解释的强大基线。

ABSTRACT

In this work, we establish a baseline potential for how modern model-generated text explanations of movie recommendations may help users, and explore what different components of these text explanations that users like or dislike, especially in contrast to existing human movie reviews. We found that participants gave no significantly different rankings between movies, nor did they give significantly different individual quality scores to reviews of movies that they had never seen before. However, participants did mark reviews as significantly better when they were movies they had seen before. We also explore specific aspects of movie review texts that participants marked as important for each quality. Overall, we establish that modern LLMs are a promising source of recommendation explanations, and we intend on further exploring personalizable text explanations in the future.

研究动机与目标

  • 建立现代大型语言模型(LLM)生成的文本解释如何提升推荐系统用户体验的基线。
  • 探究GPT生成的评论是否在影响用户偏好方面,被认为与人工撰写评论同等或更有效。
  • 识别用户认为在准确性、信息量、说服力和趣味性方面最具价值的评论文本组成部分,如结构、内容、语气或个性化程度。
  • 探索大型语言模型生成个性化、以用户为中心的推荐解释的潜力,以提升用户满意度与透明度。

提出的方法

  • 在模拟电影推荐环境的调查中,共招募120名参与者。
  • 向参与者展示成对的电影推荐:其中一项配有GPT生成的解释,另一项配有由人工撰写的评论。
  • 通过排序任务和四项维度的独立质量评分来衡量用户偏好:准确性、信息量、说服力和趣味性。
  • 分析自由格式反馈,识别用户认为有价值或被批评的关键文本要素,包括剧情概要、类型、演员、文化背景和写作风格。
  • 采用受控设计,对比已观看和未观看电影的模型生成与人工生成评论,以隔离先前观看经历的影响。
  • 使用李克特量表评分和定性分析,评估用户对评论质量与偏好的感知。

实验结果

研究问题

  • RQ1与人工生成的文本相比,当推荐电影时使用模型生成的文本解释,是否会影响用户对观看偏好的排序,特别是对于他们尚未看过的电影?
  • RQ2与人工撰写的评论相比,模型生成的文本解释在准确性、信息量、说服力和趣味性方面的个体质量评分是否存在显著差异?
  • RQ3用户认为哪些具体的文本组成部分(如剧情概要、类型、个人轶事、语气)对评论质量最为重要或最具破坏性?
  • RQ4对电影的先前接触经历在多大程度上影响了用户对推荐解释质量与说服力的感知?

主要发现

  • 对于参与者尚未观看过的电影,当推荐附带GPT生成或人工撰写评论时,其观看偏好排序无显著差异。
  • 对于参与者已观看过的电影,GPT生成的评论在所有质量维度上均显著优于人工撰写的评论。
  • 用户更重视结构化的项目特征,如类型、演员和媒体评价,尤其是在准确性和信息量方面。
  • 写作风格和语气常被视为影响说服力和趣味性的关键因素,用户批评过于个人化、模糊或过于冗长的评论。
  • 用户常批评仅聚焦于个人轶事而缺乏剧情概要或客观信息的人工评论,而GPT生成的文本则被认为更具平衡性与信息量。
  • 尽管在未观看电影的情况下性能差异不显著,但已观看电影的李克特量表效应更强,表明在用户已有先前经验的情境下,GPT生成的评论更具有效性。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。