[论文解读] Attention-based Mixture Density Recurrent Networks for History-based Recommendation
本文提出了一种基于注意力机制的混合密度循环神经网络,用于建模基于历史记录的多模态用户行为分布。通过使用连续的物品嵌入并利用注意力机制按顺序生成混合组件,该模型在MovieLens-20M和RecSys15数据集上的精确率、召回率和nDCG指标上均优于基线模型。
The goal of personalized history-based recommendation is to automatically output a distribution over all the items given a sequence of previous purchases of a user. In this work, we present a novel approach that uses a recurrent network for summarizing the history of purchases, continuous vectors representing items for scalability, and a novel attention-based recurrent mixture density network, which outputs each component in a mixture sequentially, for modelling a multi-modal conditional distribution. We evaluate the proposed approach on two publicly available datasets, MovieLens-20M and RecSys15. The experiments show that the proposed approach, which explicitly models the multi-modal nature of the predictive distribution, is able to improve the performance over various baselines in terms of precision, recall and nDCG.
研究动机与目标
- 解决矩阵分解和基于分类的模型在捕捉随时间变化的动态、多模态用户偏好方面的局限性。
- 通过将物品预测建模为连续向量分布而非离散分类,克服大规模词汇表推荐中的可扩展性问题。
- 通过混合密度网络显式建模用户行为的多模态特性——即用户可能具有多个不同的偏好。
- 通过注意力机制在生成混合组件时动态加权历史物品,从而提升推荐性能。
- 通过将物品表征学习与主推荐模型解耦,实现对新物品更好的泛化能力与可扩展性。
提出的方法
- 使用循环神经网络(RNN)将用户的序列购买历史编码为固定长度的上下文向量。
- 采用预训练的连续物品嵌入(例如通过word2vec)在低维、可扩展的空间中表示物品。
- 实现一种基于注意力机制的循环混合密度网络(RMDN),按顺序生成混合组件,以建模未来物品的条件分布。
- 每个混合组件代表用户行为中的一个独立模式,注意力权重会动态关注生成每个组件时的相关历史物品。
- 使用密度估计损失端到端训练模型,以最大化在预测混合分布下观察到的未来物品的可能性。
- 采用混合密度网络(MDN)变体,其中输出层预测多变量高斯混合分布的参数(均值、方差、混合权重)
实验结果
研究问题
- RQ1将未来物品的条件分布建模为多模态混合分布,是否能相比单模态或基于分类的方法提升推荐性能?
- RQ2在生成混合组件时使用注意力机制,如何影响模型捕捉多样化用户偏好的能力?
- RQ3增加混合组件数量在多大程度上提升了模型对复杂、多模态用户行为的建模能力?
- RQ4将物品嵌入学习与主推荐模型解耦,是否能提升可扩展性并增强对新物品的泛化能力?
- RQ5在真实世界推荐数据集上,该方法在精确率、召回率和nDCG指标上与最先进基线相比表现如何?
主要发现
- 所提出的模型在MovieLens-20M和RecSys15数据集上的精确率、召回率和nDCG指标上均显著优于所有基线模型。
- 在MovieLens-20M数据集上,RNN-ATT-RNN-8变体实现了nDCG@20为0.2140,相比次优基线RNN-ATT-RNN-4提升了超过5%的nDCG。
- 在RecSys15数据集上,RNN-ATT-RNN-8模型实现了nDCG@20为0.2140,相比RNN-ATT-RNN-4基线实现了10%的相对提升。
- 增加混合组件数量始终能提升性能,证实了用户行为本质上具有多模态特性,且更优的多组件混合模型能更好地捕捉这种特性。
- 注意力机制使模型在生成每个混合组件时能够聚焦于相关的历史物品,从而更有效地表征多样化的用户偏好。
- 该模型在各项指标上表现稳健,RNN-ATT-RNN-8在RecSys15上实现了最高的R@20(35.78%),表明其在长尾推荐方面具有强大能力。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。