Skip to main content
QUICK REVIEW

[论文解读] Generation Meets Recommendation: Proposing Novel Items for Groups of Users

Vinh Vo Thanh, Harold Soh|arXiv (Cornell University)|Aug 2, 2018
Computational and Text Analysis Methods被引用 7
一句话总结

本文提出一种联合框架,通过利用深度生成模型——具体为协作变分自编码器(VAE)——从用户-项目评分和项目特征中学习共享潜在空间,从而为不同用户群体生成新颖且理想的项目。该方法在潜在空间中使用贪心加权最大覆盖算法,联合识别出K个高覆盖度、新颖的项目建议,实现在合成数据集和真实世界数据集(如Movielens Tag Genome)上的优异性能,其中生成的电影'基因组'具有多样性且被大规模用户群体高度评价。

ABSTRACT

Consider a movie studio aiming to produce a set of new movies for summer release: What types of movies it should produce? Who would the movies appeal to? How many movies should it make? Similar issues are encountered by a variety of organizations, e.g., mobile-phone manufacturers and online magazines, who have to create new (non-existent) items to satisfy groups of users with different preferences. In this paper, we present a joint problem formalization of these interrelated issues, and propose generative methods that address these questions simultaneously. Specifically, we leverage the latent space obtained by training a deep generative model---the Variational Autoencoder (VAE)---via a loss function that incorporates both rating performance and item reconstruction terms. We then apply a greedy search algorithm that utilizes this learned latent space to jointly obtain K plausible new items, and user groups that would find the items appealing. An evaluation of our methods on a synthetic dataset indicates that our approach is able to generate novel items similar to highly-desirable unobserved items. As case studies on real-world data, we applied our method on the MART abstract art and Movielens Tag Genome dataset, which resulted in promising results: small and diverse sets of novel items.

研究动机与目标

  • 为解决当前推荐系统仅推荐现有项目而存在的空白,提出一种为用户群体量身定制生成新项目的框架。
  • 将联合新颖项目生成与用户群体定位问题形式化为低维潜在空间中最大覆盖问题的一种变体。
  • 开发一种数据驱动的生成方法,结合评分数据与项目特征,以创建合理且高分的新项目。
  • 在合成数据和真实世界数据集(如Movielens Tag Genome、MART抽象艺术)上评估该方法,以证明其生成多样化、高覆盖度项目建议的能力。
  • 探索在创意与制造领域中,使用深度生成模型进行智能项目建议的可行性与有效性。

提出的方法

  • 利用在用户-项目评分和项目特征上训练的协作变分自编码器(VAE),学习共享的低维潜在空间。
  • 使用编码器将现有项目映射到潜在空间,使用解码器从潜在向量重建项目特征,从而实现新项目的生成。
  • 在学习到的潜在空间中应用贪心加权最大覆盖算法,联合选择K个新颖项目,以最大化预测的用户覆盖度。
  • 将优化问题形式化为约束问题,其中每个候选项目根据其对用户群体的预测吸引力进行评估,覆盖度定义为评分高于阈值τ的用户数量。
  • 在VAE训练过程中使用混合损失函数,结合评分重建与项目特征重建,以同时保持用户偏好与项目内容保真度。
  • 探索线性与深度生成模型,结果显示深度模型在合成实验中对理想缺失项目的重建性能更优。

实验结果

研究问题

  • RQ1深度生成模型能否有效学习一个共享潜在空间,以同时捕捉用户偏好与项目内容,从而实现新颖项目生成?
  • RQ2在学习到的潜在空间中,贪心最大覆盖算法在多大程度上能识别出一组K个新颖项目,使其吸引大规模且多样化的用户群体?
  • RQ3在合成设置下,深度生成模型与线性模型相比,在重建高度理想但未观测到的项目方面表现如何?
  • RQ4所提出的模型能否在真实世界数据集(如Movielens Tag Genome和MART抽象艺术)上生成合理、多样化且高分的新项目?
  • RQ5该框架中的关键设计权衡与敏感性(如对阈值τ或离散化的敏感性)是什么?

主要发现

  • 在合成数据集上,深度生成模型比线性模型更精确地重建了缺失的理想项目,从而实现了对用户空间的更好整体覆盖。
  • 生成的电影基因组中排名第一的GM-1预测覆盖了84%的用户,表明其对广大受众具有强大吸引力。
  • 五项生成的电影基因组整体预测覆盖率达94%,且每项均覆盖了此前未被覆盖的用户群体。
  • 生成的电影基因组具有多样性且直观:GM-1为情感戏剧,GM-2为黑色幽默的社会评论,GM-3为大制作科幻动作片。
  • 对顶级生成项目的分析揭示了反复出现的高影响力标签,如'剧本极佳'、'导师'和'剧情',表明高分电影具有共享特征。
  • 该方法对不同集合大小表现出鲁棒性,且对阈值τ和离散化具有一定敏感性,表明其在交互式、参数化头脑风暴中具有潜力。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。