Skip to main content
QUICK REVIEW

[论文解读] Distributed-Representation Based Hybrid Recommender System with Short Item Descriptions

Junhua He, Hankz Hankui Zhuo|arXiv (Cornell University)|Mar 15, 2017
Recommender Systems and Techniques参考文献 18被引用 15
一句话总结

本文提出 RECF,一种混合推荐系统,通过利用短项自描述的分布式词表示(word2vec)来增强稀疏评分场景下的协同过滤。通过将向量化描述中的语义项自相似性整合到矩阵分解中,RECF 显著提升了推荐准确性——尤其在数据稀疏时表现更优,优于 SVD 和使用 TF-IDF 或二值编码的 CSVD 等最先进方法。

ABSTRACT

Collaborative filtering (CF) aims to build a model from users' past behaviors and/or similar decisions made by other users, and use the model to recommend items for users. Despite of the success of previous collaborative filtering approaches, they are all based on the assumption that there are sufficient rating scores available for building high-quality recommendation models. In real world applications, however, it is often difficult to collect sufficient rating scores, especially when new items are introduced into the system, which makes the recommendation task challenging. We find that there are often "short" texts describing features of items, based on which we can approximate the similarity of items and make recommendation together with rating scores. In this paper we "borrow" the idea of vector representation of words to capture the information of short texts and embed it into a matrix factorization framework. We empirically show that our approach is effective by comparing it with state-of-the-art approaches.

研究动机与目标

  • 解决在评分数据稀疏或不完整时协同过滤推荐性能差的问题。
  • 探究是否可以利用传统协同过滤中常被忽略的短项自描述来提升推荐准确性。
  • 开发一种混合推荐系统,通过分布式表示整合短文本描述中的语义信息。
  • 评估基于 word2vec 的项自描述向量化在增强基于矩阵分解的协同过滤中的有效性。
  • 优化评分数据与基于描述的相似性之间的权衡,以防止过拟合并提升收敛性。

提出的方法

  • 使用预训练的 word2vec 模型将短项自描述转换为稠密向量表示,以捕捉语义相似性。
  • 通过项自描述的 word2vec 向量平均值构建描述矩阵 C,表示项与项之间的语义相似性。
  • 通过在联合目标函数中将描述矩阵 C 与用户-项评分矩阵 R 和标签矩阵 L 结合,将描述矩阵 C 整合到矩阵分解框架中。
  • 使用期望最大化算法优化混合目标函数,平衡来自评分、标签和基于描述的相似性的贡献。
  • 动态调整权衡参数 λC:初始时设为正值以早期注入描述信息,随后逐步降低至零,以防止过拟合并让评分数据在后期迭代中主导。
  • 采用两阶段收敛策略:在初始学习阶段激活 λC,以指导缺失评分的填补;随后将其关闭,以利用评分和标签数据进一步优化预测。

实验结果

研究问题

  • RQ1在数据稀疏条件下,短项自描述的分布式表示能否提升协同过滤的推荐准确性?
  • RQ2在稀疏评分设置下,基于短描述的语义项自相似性整合方式与传统的 TF-IDF 或二值编码相比表现如何?
  • RQ3在学习过程中,评分数据与基于描述的相似性之间的最优动态权衡是什么?
  • RQ4使用 word2vec 嵌入是否能缓解频率方法在项自描述短且稀疏时的局限性?
  • RQ5在真实世界中评分稀疏的数据集上,RECF 框架相对于最先进混合推荐系统的表现如何?

主要发现

  • 在 MovieLens 和 Douban 数据集上,RECF 相较于 SVD 和 CSVD,显著降低了 MAE 和 RMSE,且随着评分稀疏性的增加,优势更加明显。
  • 在 Douban 数据集上,由于描述仅限于标签,使用 TF-IDF 或二值编码的 CSVD 表现差甚至导致性能下降,而 RECF 通过利用语义词嵌入保持了高准确性。
  • RECF 的性能随数据稀疏性的增加而提升,表明当评分数据稀缺时,基于描述的相似性更具价值。
  • 两阶段优化策略——初期强调描述矩阵 C,后期将其关闭——有助于更好收敛并避免过拟合,从而提升最终推荐准确性。
  • 通过将 λC 从初始值动态调整至零,RECF 在 MAE 上相比静态基线提升了 15-20%,证明了在混合模型中时间加权的重要性。
  • 在两个数据集上,RECF 显著优于 CSVD+TFIDF 和 CSVD+Binary,证实基于 word2vec 的语义建模在短文本上比基于频率的方法更有效。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。