Skip to main content
QUICK REVIEW

[论文解读] Dropout Training of Matrix Factorization and Autoencoder for Link Prediction in Sparse Graphs

Shuangfei Zhai, Zhongfei Zhang|arXiv (Cornell University)|Dec 14, 2015
Advanced Graph Neural Networks参考文献 30被引用 7
一句话总结

该论文提出 MF+AE,一种通过 dropout 训练的联合矩阵分解与自编码器模型,用于稀疏图中的链接预测。通过共享参数统一 MF 与 AE,并使用 dropout 作为自适应正则化,该方法显著提升了泛化能力,尤其在非凝聚图上表现优异,在六个真实世界数据集上均优于现有方法。

ABSTRACT

Matrix factorization (MF) and Autoencoder (AE) are among the most successful approaches of unsupervised learning. While MF based models have been extensively exploited in the graph modeling and link prediction literature, the AE family has not gained much attention. In this paper we investigate both MF and AE's application to the link prediction problem in sparse graphs. We show the connection between AE and MF from the perspective of multiview learning, and further propose MF+AE: a model training MF and AE jointly with shared parameters. We apply dropout to training both the MF and AE parts, and show that it can significantly prevent overfitting by acting as an adaptive regularization. We conduct experiments on six real world sparse graph datasets, and show that MF+AE consistently outperforms the competing methods, especially on datasets that demonstrate strong non-cohesive structures.

研究动机与目标

  • 为解决在稀疏图中链接预测时的过拟合问题,特别是针对复杂且非凝聚的网络结构建模挑战。
  • 探索在图表示学习的多视图学习背景下,矩阵分解(MF)与自编码器(AE)之间的关联。
  • 开发一种统一模型 MF+AE,通过共享参数联合训练 MF 与 AE,以增强表征学习能力。
  • 研究 dropout 作为隐式正则化技术在稳定训练和提升 MF 与 AE 组件泛化能力方面的有效性。
  • 在多样化的现实世界稀疏图上评估所提方法,并展示其在性能上持续优于最先进基线模型。

提出的方法

  • 提出 MF+AE,一种联合模型,通过共享权重矩阵联合训练矩阵分解与自编码器组件,使来自同一数据两组视图的互补学习成为可能。
  • 在训练过程中对 MF 与 AE 组件均应用 dropout,其通过隐式惩罚权重矩阵行或列的缩放 ℓ₂ 范数,实现自适应正则化。
  • 通过二阶泰勒展开推导 dropout 的影响,表明其近似于对潜在因子的动态 ℓ₂ 惩罚。
  • 采用随机梯度下降进行优化,实现对大规模稀疏图的可扩展性。
  • 在 MF 和 AE 的对称版本中使用权重共享,以减少参数数量并提升泛化能力。
  • 使用标准链接预测指标(如 AUC、AUPR)在六个真实世界稀疏图数据集上评估模型性能。

实验结果

研究问题

  • RQ1如何在单一模型下统一矩阵分解与自编码器,以提升稀疏图中的链接预测性能?
  • RQ2在 MF 与 AE 组件中同时应用 dropout 的理论与实证影响为何?其在正则化与泛化方面有何作用?
  • RQ3MF 与 AE 通过共享参数进行联合训练,是否能带来优于独立模型或现有基线模型的性能提升?
  • RQ4该模型在非凝聚结构图(如以关注者-被关注者关系为主导的图)上的表现如何?
  • RQ5在稀疏图中常见的低数据场景下,dropout 训练是否能有效缓解 MF 与 AE 的过拟合?

主要发现

  • MF+AE 在所有六个真实世界稀疏图数据集上均持续优于所有对比方法,包括 MF、AE、MDM 及其 dropout 正则化变体。
  • dropout 训练显著降低了 MF 与 AE 组件的过拟合,表现为更好的泛化能力,且可视化结果中误报/误报更少。
  • 在非凝聚图(如 YouTube 和 Gplus)上,MF+AE 的性能提升远超在凝聚图上的表现,表明其对非对称、非对称链接模式具有更优的建模能力。
  • 预测结果的可视化显示,MF+AE 的输出在视觉上最接近完整图,而 MFd 和 AEd 产生更多误报,MDM 则产生更多误报。
  • 对称版本的 MF 在凝聚图(如 Facebook、Twitter)上表现更优,而非对称版本在非凝聚图上更有效,支持 MF+AE 中灵活建模的必要性。
  • 在 AE 中使用非线性激活函数可提供比线性模型更强的建模能力,这对捕捉复杂且非凝聚的结构至关重要。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。