Skip to main content
QUICK REVIEW

[论文解读] A Bayesian Tensor Factorization Model via Variational Inference for Link Prediction

Beyza Ermiş, Ali Taylan Cemgil|arXiv (Cornell University)|Sep 29, 2014
Tensor decomposition and applications参考文献 15被引用 15
一句话总结

本文提出了一种基于变分贝叶斯张量分解的链接预测模型,结合了概率潜在张量分解(PLTF)与广义耦合张量分解(GCTF)框架。通过采用共轭先验和高效的变分推断,该方法在不完整的真实世界数据集上相比最大似然方法,实现了更优的预测性能和更强的抗过拟合能力。

ABSTRACT

Probabilistic approaches for tensor factorization aim to extract meaningful structure from incomplete data by postulating low rank constraints. Recently, variational Bayesian (VB) inference techniques have successfully been applied to large scale models. This paper presents full Bayesian inference via VB on both single and coupled tensor factorization models. Our method can be run even for very large models and is easily implemented. It exhibits better prediction performance than existing approaches based on maximum likelihood on several real-world datasets for missing link prediction problem.

研究动机与目标

  • 开发一种完整的贝叶斯推断框架用于张量分解,能够自然地处理缺失数据。
  • 通过在PLTF与GCTF模型上应用变分贝叶斯推断,提升链接预测任务的预测性能。
  • 提供一种可扩展且计算高效的算法,避免最大似然估计中常见的过拟合问题。
  • 展示在存在缺失数据的情况下,变分方法在模型阶数选择上的鲁棒性。

提出的方法

  • 采用具有泊松似然和伽马先验的层次生成模型,以支持共轭变分推断。
  • 应用变分贝叶斯推断,近似PLTF与GCTF模型中潜在因子的后验分布。
  • 采用比平均场更丰富的近似方式,将完整条件分布建模为多项式分布的乘积。
  • 通过稀疏和低秩张量表示解决推断问题,实现对大规模数据集的可扩展性。
  • 基于共轭指数族分布推导变分参数的更新规则。
  • 将该方法扩展至耦合张量分解,支持对具有共享潜在因子的异构关系数据进行联合建模。

实验结果

研究问题

  • RQ1在使用张量分解进行链接预测时,变分贝叶斯推断是否能优于最大似然估计?
  • RQ2所提出的方法如何处理大规模张量分解问题中的缺失数据?
  • RQ3与基于EM的方法相比,变分贝叶斯方法是否能减少过拟合,尤其是在模型复杂度增加时?
  • RQ4在存在缺失数据的情况下,该方法对错误的模型阶数选择有多大的鲁棒性?
  • RQ5该框架能否在保持高预测准确率的同时,高效扩展至大规模真实世界数据集?

主要发现

  • 所提出的变分贝叶斯(VB)方法在所有测试数据集上,包括Digg和Friendster,均显著优于基于EM的方法,AUC得分更高。
  • 在Digg数据集(80%缺失数据)上,VB的AUC为0.961 ± 0.001,优于EM的0.892 ± 0.003。
  • 随着模型阶数从R=2增加到R=20,VB方法的性能下降极小,而基于EM的方法则急剧下降,表明其对过拟合具有更强的鲁棒性。
  • 该方法在不同缺失数据水平(40%、60%、80%)下均保持稳定性能,展现出强大的泛化能力。
  • 该方法具有高效的可扩展性,即使在Friendster等大规模数据集上,推理时间也仅适度增加,而EM方法则变得计算上不可行。
  • 通过使用共轭先验和结构化变分近似,实现了准确的后验推断,且计算开销无明显增加。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。