[论文解读] Relation Learning on Social Networks with Multi-Modal Graph Edge Variational Autoencoders
本文提出 ReLearn,一种多模态图边变分自编码器,通过图卷积网络与针对文本、属性和扩散信号的多个重建头,联合建模社交网络链接上的潜在关系分布。该方法在无监督关系学习中表现优异,对噪声和不完整数据具有鲁棒性,并通过生成采样与多解码器解码实现可解释的关系发现。
While node semantics have been extensively explored in social networks, little research attention has been paid to profile edge semantics, i.e., social relations. Ideal edge semantics should not only show that two users are connected, but also why they know each other and what they share in common. However, relations in social networks are often hard to profile, due to noisy multi-modal signals and limited user-generated ground-truth labels. In this work, we aim to develop a unified and principled framework that can profile user relations as edge semantics in social networks by integrating multi-modal signals in the presence of noisy and incomplete data. Our framework is also flexible towards limited or missing supervision. Specifically, we assume a latent distribution of multiple relations underlying each user link, and learn them with multi-modal graph edge variational autoencoders. We encode the network data with a graph convolutional network, and decode arbitrary signals with multiple reconstruction networks. Extensive experiments and case studies on two public DBLP author networks and two internal LinkedIn member networks demonstrate the superior effectiveness and efficiency of our proposed model.
研究动机与目标
- 为解决社交网络链接上隐式关系语义的学习挑战,其中关系通常定义不明确且存在噪声。
- 将多模态信号——网络邻近性、用户属性和信息扩散——整合到统一的边级别关系建模范式中。
- 开发一种灵活、鲁棒且可扩展的模型,能够在有限或无监督条件下有效运行。
- 通过从学习到的潜在分布中生成并解码边表示,实现可解释的关系发现。
提出的方法
- 该模型使用带有邻域采样的图卷积网络(GCN)对大规模网络中的节点和边表示进行编码。
- 使用高斯混合变分自编码器(GM-VAE)对每条链接的关系类型潜在分布进行建模,其中全局关系原型作为高斯分量。
- 采用两步蒙特卡洛采样进行变分推断,以估计全局参数和局部关系分布。
- 多个专用解码器分别重建来自文本、用户属性和信息扩散的信号,实现多模态信号的融合。
- 通过重建损失端到端训练框架,实现编码器与多个解码器的联合优化。
- 通过从学习到的混合模型中采样生成边表示,支持关系特定内容的解释与生成。
实验结果
研究问题
- RQ1如何有效建模多模态信号——网络结构、用户属性和信息扩散——以实现社交网络链接上的关系学习?
- RQ2在存在噪声和不完整数据的情况下,如何为每条链接学习到关系的潜在分布?
- RQ3统一的生成模型能否同时重建多种模态,同时保持对属性噪声和缺失链接的鲁棒性?
- RQ4如何通过生成采样与多解码器解码来解释学习到的潜在关系?
主要发现
- ReLearn 在两个公开的 DBLP 网络和两个内部 LinkedIn 网络上的关系学习任务中达到最先进性能,无论在链接预测还是关系分类任务中均优于强基线模型。
- 该模型对属性噪声表现出强大鲁棒性,在高达 50% 的属性向量被单位高斯噪声污染的情况下仍保持高性能。
- ReLearn 在链接被移除的情况下依然有效,当网络中随机移除 2% 至 10% 的现有链接时,性能保持稳定。
- 使用主成分分析(PCA)对学习到的边表示进行可视化,显示出关系类型(如同事和校友)的清晰聚类,证实了模型对不同类型关系的解耦能力。
- 从学习到的高斯混合模型中进行生成采样,并通过多头解码揭示了可解释的内容模式:例如,‘Management’ 和 ‘Performance’ 代表同事关系,‘Learning’ 和 ‘Advising’ 代表校友关系。
- ReLearn 的运行时间与高效基线模型(如 PTE 和 GraphSage)相当,且显著快于更重的模型(如 STNE 和 Inf2vec),表明其具备良好的可扩展性。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。