[论文解读] UPRec: User-Aware Pre-training for Recommender Systems
UPRec 提出了一种用户感知的预训练框架,用于推荐系统,通过两项新颖的任务——用户属性预测和社会关系检测——将异构用户信息(如用户属性和社会图谱)整合到预训练过程中。通过利用这些任务,UPRec 显著提升了序列推荐的性能,尤其是在数据稀疏的情况下,在 YELP 等真实世界数据集上超越了现有的预训练模型。
Existing sequential recommendation methods rely on large amounts of training data and usually suffer from the data sparsity problem. To tackle this, the pre-training mechanism has been widely adopted, which attempts to leverage large-scale data to perform self-supervised learning and transfer the pre-trained parameters to downstream tasks. However, previous pre-trained models for recommendation focus on leverage universal sequence patterns from user behaviour sequences and item information, whereas ignore capturing personalized interests with the heterogeneous user information, which has been shown effective in contributing to personalized recommendation. In this paper, we propose a method to enhance pre-trained models with heterogeneous user information, called User-aware Pre-training for Recommendation (UPRec). Specifically, UPRec leverages the user attributes andstructured social graphs to construct self-supervised objectives in the pre-training stage and proposes two user-aware pre-training tasks. Comprehensive experimental results on several real-world large-scale recommendation datasets demonstrate that UPRec can effectively integrate user information into pre-trained models and thus provide more appropriate recommendations for users.
研究动机与目标
- 为通过整合行为序列之外的异构用户信息来解决序列推荐中的数据稀疏性问题。
- 设计能够有效利用用户属性和社会图谱的自监督预训练任务。
- 通过将符号化、表格化和图结构化的用户数据融合到统一编码器中,改进用户表征学习。
- 证明用户感知的预训练相比标准预训练能带来更好的下游推荐性能。
提出的方法
- UPRec 使用统一的基于 Transformer 的编码器,在共享嵌入空间中处理用户行为序列、用户属性和社会图谱。
- 引入用户属性预测任务,即模型从用户的行为历史中预测缺失的用户档案特征。
- 设计社会关系检测任务,利用对比学习区分社会图谱中的真实用户对与负样本对。
- 模型通过掩码语言建模和对比学习目标,联合在行为序列、用户属性和社会关系上进行预训练。
- 采用多任务学习策略,将两项用户感知的预训练任务与标准的掩码物品预测任务(Cloze 风格)相结合。
- 预训练完成后,使用标准优化方法在下游序列推荐任务上进行微调。
实验结果
研究问题
- RQ1将用户属性和社会图谱等异构用户信息整合是否能提升预训练推荐模型的性能?
- RQ2用户感知的预训练任务(属性预测和社会关系检测)在增强用户表征学习方面有多有效?
- RQ3在数据稀疏条件下,使用用户感知目标进行预训练是否能带来更好的序列推荐性能?
- RQ4学习率、批量大小和隐藏层大小等超参数如何影响用户感知预训练的性能?
- RQ5UPRec 是否能泛化到序列推荐之外的其他推荐任务?
主要发现
- UPRec 在多个真实世界数据集(包括 YELP、Amazon 和 Diginom)的序列推荐任务中达到最先进性能,NDCG@10 和 MRR 指标均有显著提升。
- 消融实验证实,用户属性预测和社会关系检测两项任务均对模型性能有积极贡献,且联合任务表现优于单一组件。
- UPRec 在预训练阶段收敛迅速,前 30 个训练周期内即实现显著性能提升,表明其能有效从异构用户数据中学习特征。
- 较大的批量大小在预训练阶段带来更好的下游性能,从 128 增加到 768 时性能显著提升,表明优化过程稳定且高效。
- 在 YELP 数据集上,最优隐藏层大小为 96;更大的隐藏层大小(如 160)会导致过拟合和性能下降。
- 模型展现出强大的泛化能力,即使在低数据场景下也观察到性能提升,证实其在缓解数据稀疏性方面的有效性。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。