[论文解读] Pre-training Graph Transformer with Multimodal Side Information for Recommendation
该论文提出预训练多模态图Transformer(PMGT),一种自监督预训练框架,通过在同质物品图中联合建模多模态辅助信息(文本、图像)和用户驱动的物品关系,学习物品表征。通过利用图结构重建和掩码节点特征重建,PMGT在真实数据集上的物品推荐、点击率预测和物品分类任务中均达到最先进性能,在线上A/B测试中实现视频播放量提升6.80%。
Side information of items, e.g., images and text description, has shown to be effective in contributing to accurate recommendations. Inspired by the recent success of pre-training models on natural language and images, we propose a pre-training strategy to learn item representations by considering both item side information and their relationships. We relate items by common user activities, e.g., co-purchase, and construct a homogeneous item graph. This graph provides a unified view of item relations and their associated side information in multimodality. We develop a novel sampling algorithm named MCNSampling to select contextual neighbors for each item. The proposed Pre-trained Multimodal Graph Transformer (PMGT) learns item representations with two objectives: 1) graph structure reconstruction, and 2) masked node feature reconstruction. Experimental results on real datasets demonstrate that the proposed PMGT model effectively exploits the multimodality side information to achieve better accuracies in downstream tasks including item recommendation, item classification, and click-through ratio prediction. We also report a case study of testing the proposed PMGT model in an online setting with 600 thousand users.
研究动机与目标
- 解决现有推荐模型对多模态辅助信息(如文本、图像)和孤立物品关系利用不足的局限性。
- 开发一个统一框架,将物品的多模态特征和用户驱动的物品关系(如共同购买)联合建模于单一图结构中。
- 通过在该统一多模态图上使用自监督目标预训练图神经网络,提升下游推荐任务的性能。
- 在离线基准测试和真实线上部署中验证所提出预训练策略的有效性。
提出的方法
- 构建一个同质物品图,其中节点代表物品,边代表用户交互中的共现关系(如共同购买),边权基于交互频率确定。
- 提出一种新颖的采样算法MCNSampling,为每个物品选择上下文相关的邻居,以增强表征学习。
- 使用多模态特征(文本、图像)、位置-ID嵌入和角色标签嵌入初始化节点表征,以丰富输入表示。
- 使用两种自监督目标进行模型训练:图结构重建和掩码节点特征重建。
- 在下游任务(如物品推荐、点击率预测、物品分类)上微调预训练模型,采用冻结主干网络和可训练分类头。
- 在在线案例研究中,使用预训练表征的余弦相似度进行视频检索,并与ItemKNN结合用于最终排序。
实验结果
研究问题
- RQ1在统一多模态物品图上进行预训练是否能提升推荐系统的表征学习能力?
- RQ2所提出的自监督预训练策略(图结构重建和掩码特征重建)在捕捉物品内容和关系信息方面的有效性如何?
- RQ3PMGT模型是否在多样化的下游任务中具有泛化能力,包括物品推荐、点击率预测和物品分类?
- RQ4预训练表征是否能在真实线上推荐系统中超越现有基线模型?
主要发现
- PMGT在三个真实世界数据集(MI、IS、ML)上的所有下游任务——物品推荐、点击率预测和物品分类——均达到最先进性能。
- 与将预训练目标替换为分类任务的PMGT-NP相比,预训练的PMGT表现更优,证明了自监督预训练的价值。
- 在淘宝视频推荐系统的线上A/B测试中,PMGT相比使用UNITER嵌入的基线模型,使新视频播放量提升了6.80%。
- 案例研究显示,基于PMGT的视频检索比基于UNITER的检索产生更多样化的推荐,表明其具备更优的语义和关系理解能力。
- 该模型在不同数据模态和任务上表现稳健,证实了联合建模多模态特征和用户驱动物品关系的有效性。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。