[论文解读] Tripartite Heterogeneous Graph Propagation for Large-scale Social Recommendation
该论文提出了一种新型图神经网络方法——异质图传播(Heterogeneous Graph Propagation, HGP),用于大规模社交推荐,通过构建三部图(用户-群组-物品)来降低噪声和复杂度。通过应用个性化PageRank进行传播,并结合用户-群组与用户-物品子图嵌入的注意力融合,HGP有效缓解了过度平滑问题并处理了异质性,在包含160万个节点和470万个边的真实世界数据集上实现了最先进性能。
Graph Neural Networks (GNNs) have been emerging as a promising method for relational representation including recommender systems. However, various challenging issues of social graphs hinder the practical usage of GNNs for social recommendation, such as their complex noisy connections and high heterogeneity. The oversmoothing of GNNs is an obstacle of GNN-based social recommendation as well. Here we propose a new graph embedding method Heterogeneous Graph Propagation (HGP) to tackle these issues. HGP uses a group-user-item tripartite graph as input to reduce the number of edges and the complexity of paths in a social graph. To solve the oversmoothing issue, HGP embeds nodes under a personalized PageRank based propagation scheme, separately for group-user graph and user-item graph. Node embeddings from each graph are integrated using an attention mechanism. We evaluate our HGP on a large-scale real-world dataset consisting of 1,645,279 nodes and 4,711,208 edges. The experimental results show that HGP outperforms several baselines in terms of AUC and F1-score metrics.
研究动机与目标
- 利用图神经网络(GNNs)解决社交推荐中高复杂度、噪声和过度平滑的挑战。
- 通过引入群组节点聚合相关用户,降低大规模用户-用户图中的计算成本和内存使用。
- 通过采用基于个性化PageRank的传播机制而非标准消息传递,克服GNN中的过度平滑问题。
- 通过类型特定预测和注意力融合机制,有效整合异质图结构(用户-群组与用户-物品关系)。
- 通过适用于异质图场景的高效采样技术,实现在大规模社交图上的可扩展训练。
提出的方法
- 构建包含群组、用户和物品节点的三部图属性多层异质图,以建模社交与协同关系。
- 利用群组节点表示具有共同社交属性的用户群体,消除直接的用户-用户边,降低图的复杂度。
- 在用户-群组和用户-物品子图中均应用个性化PageRank进行节点嵌入传播,以防止过度平滑。
- 使用群组主题、人口统计信息和物品类别等属性生成初始节点特征。
- 为每种节点类型训练独立的单层感知机以预测用户偏好,采用ReLU激活函数和Adam优化。
- 通过注意力机制融合两个子图的嵌入,生成用于推荐的联合用户-物品表示。
实验结果
研究问题
- RQ1三部图(群组-用户-物品)是否能降低大规模社交推荐图中的计算复杂度和噪声?
- RQ2基于个性化PageRank的传播是否能有效缓解GNN在社交推荐中的过度平滑问题?
- RQ3对异质子图(用户-群组与用户-物品)嵌入进行注意力融合,能否显著提升推荐性能?
- RQ4所提出的HGP模型是否能在真实世界大规模数据集(超过160万个节点和470万个边)上实现高效可扩展?
- RQ5增加传播步数是否能提升性能而不引发过度平滑或性能退化?
主要发现
- HGP在真实世界数据集上取得了最高的ROC-AUC(0.6365)、PR-AUC(0.6378)和F1-score(0.5967),显著优于所有基线模型,包括FastGCN、metapath2vec+EGES和MNE+EGES。
- 该模型在NSML平台上半天内即可收敛,适用于工业推荐系统中的每日服务更新。
- 学习时间从约45小时(无采样)缩短至约1.1小时(使用采样),证明了采样策略在可扩展性方面的有效性。
- 随着传播步数增加(最多至k=10),性能持续提升,表明长距离社交影响被有效捕捉且未出现过度平滑。
- 当k=10时,HGP模型达到最佳性能,证实个性化PageRank能够实现深层网络中稳定且有效的消息传递。
- 消融实验证明,缺乏节点属性(如metapath2vec)的模型无法学习CTR预测,凸显了基于属性初始化的重要性。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。