Skip to main content
QUICK REVIEW

[论文解读] Joint Text Embedding for Personalized Content-based Recommendation

Ting Chen, Liangjie Hong|arXiv (Cornell University)|Jun 4, 2017
Recommender Systems and Techniques参考文献 21被引用 20
一句话总结

本文提出了一种联合文本嵌入框架,结合了有监督的用户-项目交互数据与无监督的文本嵌入,以实现对无任何交互历史的新项目的内容个性化推荐。通过使用交互数据端到端联合训练用户嵌入与文本嵌入,并利用一种新颖的组合模块进行融合,该模型在真实世界数据集上显著提升了推荐性能,实现了冷启动内容推荐的最先进结果。

ABSTRACT

Learning a good representation of text is key to many recommendation applications. Examples include news recommendation where texts to be recommended are constantly published everyday. However, most existing recommendation techniques, such as matrix factorization based methods, mainly rely on interaction histories to learn representations of items. While latent factors of items can be learned effectively from user interaction data, in many cases, such data is not available, especially for newly emerged items. In this work, we aim to address the problem of personalized recommendation for completely new items with text information available. We cast the problem as a personalized text ranking problem and propose a general framework that combines text embedding with personalized recommendation. Users and textual content are embedded into latent feature space. The text embedding function can be learned end-to-end by predicting user interactions with items. To alleviate sparsity in interaction data, and leverage large amount of text data with little or no user interactions, we further propose a joint text embedding model that incorporates unsupervised text embedding with a combination module. Experimental results show that our model can significantly improve the effectiveness of recommendation systems on real-world datasets.

研究动机与目标

  • 解决缺乏用户交互历史的新项目在个性化推荐中的冷启动问题。
  • 通过同时利用标注数据(用户交互)和未标注数据(大规模文本语料)来学习丰富的、深层的文本表示,以改进基于内容的推荐。
  • 开发一个统一的框架,端到端联合学习用户嵌入与文本嵌入函数,以实现有效的个性化排序。
  • 克服传统方法的局限性,这些方法依赖于稀疏的词袋表示或未利用预训练文本嵌入的简单神经网络。
  • 设计一种组合模块,有效融合有监督与无监督的文本嵌入,以提升语义理解能力。

提出的方法

  • 该模型联合学习用户嵌入与一个将文本序列映射为稠密向量的神经文本嵌入函数。
  • 用户与项目偏好通过共享潜在空间中的点积相似度进行建模,并使用隐式用户反馈进行端到端训练。
  • 使用深度神经网络(如卷积神经网络)作为文本嵌入函数,以捕捉文本中的层次化与上下文特征。
  • 在大规模未标注语料上预训练无监督文本嵌入模型,以捕捉通用的语义模式。
  • 设计一种新颖的组合模块,融合有监督与无监督的文本嵌入,使模型能够同时利用任务特定表示与通用表示。
  • 整个框架使用交互数据作为监督信号进行端到端训练,实现用户与文本表示的联合优化。

实验结果

研究问题

  • RQ1结合用户交互数据与预训练文本嵌入的联合学习框架,能否提升对新项目的个性化推荐性能?
  • RQ2基于神经网络的文本嵌入函数,若在用户交互数据上端到端训练,能否有效捕捉推荐任务相关的语义特征?
  • RQ3将无监督预训练嵌入与有监督交互驱动嵌入进行融合,在冷启动项目上的模型性能提升程度如何?
  • RQ4所提出的组合模块是否在捕捉相关语义与用户特定偏好方面优于简单的嵌入拼接或平均操作?
  • RQ5在真实世界数据集上,该模型在排序准确率与泛化能力方面与现有最先进方法相比表现如何?

主要发现

  • 所提出的联合文本嵌入模型在两个真实世界数据集上对新内容的推荐任务中达到了最先进性能。
  • 有监督与无监督文本嵌入的结合显著提升了推荐效果,尤其在冷启动项目上表现突出。
  • 该模型能够准确区分词语的不同语义含义——例如,在有监督模型中,'neural' 正确关联到人工神经网络,而在用户行为语境中则与神经科学相关。
  • 检索结果表明,与仅使用无监督嵌入相比,该框架能生成更相关且语义一致的相似文章。
  • 组合模块有效融合了多种嵌入源,使模型泛化能力更强,排序性能优于基线方法。
  • 实证结果表明,使用交互监督进行端到端训练,可获得比孤立使用预训练嵌入更符合任务需求的文本表示。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。