Skip to main content
QUICK REVIEW

[论文解读] Discriminative Nonparametric Latent Feature Relational Models with Data Augmentation

Bei Chen, Ning Chen|arXiv (Cornell University)|Dec 7, 2015
Bayesian Methods and Mixture Models参考文献 32被引用 3
一句话总结

该论文提出了一种判别性非参数潜在特征关系模型(DLFRM),通过数据增强和Gibbs采样实现大规模网络中未知潜在特征维度的可扩展、端到端链接预测。通过将正则化贝叶斯推断与逻辑损失和合页损失相结合,该方法有效处理类别不平衡问题,并在包含多达数十万实体和数百万条链接的真实世界网络上达到最先进性能。

ABSTRACT

We present a discriminative nonparametric latent feature relational model (LFRM) for link prediction to automatically infer the dimensionality of latent features. Under the generic RegBayes (regularized Bayesian inference) framework, we handily incorporate the prediction loss with probabilistic inference of a Bayesian model; set distinct regularization parameters for different types of links to handle the imbalance issue in real networks; and unify the analysis of both the smooth logistic log-loss and the piecewise linear hinge loss. For the nonconjugate posterior inference, we present a simple Gibbs sampler via data augmentation, without making restricting assumptions as done in variational methods. We further develop an approximate sampler using stochastic gradient Langevin dynamics to handle large networks with hundreds of thousands of entities and millions of links, orders of magnitude larger than what existing LFRM models can process. Extensive studies on various real networks show promising performance.

研究动机与目标

  • 解决链接预测中潜在特征维度未知的问题,无需依赖模型选择或固定K值。
  • 通过为正样本和负样本分配不同的正则化参数,有效处理真实网络中的类别不平衡问题。
  • 在单一正则化贝叶斯推断框架下统一分析平滑的逻辑损失和非平滑的合页损失。
  • 通过数据增强开发高效的Gibbs采样器,避免变分方法的严格假设。
  • 利用随机梯度朗之万动力学(SGLD)将方法扩展至大规模网络,实现近似推断。

提出的方法

  • 将链接预测建模为判别性贝叶斯模型,利用RegBayes框架将预测损失与后验推断相结合。
  • 应用数据增强将非共轭后验推断转化为条件共轭形式,从而支持简单的Gibbs采样。
  • 采用印度餐厅过程(IBP)作为潜在特征的非参数先验,以自动发现特征维度。
  • 引入独立的正则化参数 $c^+$ 和 $c^-$ 分别用于正样本和负样本,以缓解数据不平衡问题。
  • 通过SGLD开发一种随机近似Gibbs采样器,使方法可扩展至包含10万+实体和100万+链接的网络。
  • 通过正则化推断统一处理逻辑损失和合页损失。

实验结果

研究问题

  • RQ1非参数潜在特征模型是否能自动推断出正确的潜在特征数量而无需预先指定?
  • RQ2在真实网络中,如何在潜在特征模型的链接预测中有效处理类别不平衡问题?
  • RQ3平滑(逻辑)损失和非平滑(合页)损失函数能否在单一推断框架下统一处理,用于判别性链接预测?
  • RQ4数据增强是否能实现高效、非截断的Gibbs采样,而无需施加严格的平均场或截断假设?
  • RQ5所提方法是否能扩展至包含数十万实体和数百万链接的大规模网络?

主要发现

  • 所提出的DLFRM结合数据增强和Gibbs采样后收敛迅速且稳定,测试AUC在150个热身步骤内即趋于稳定。
  • 将 $c^+ / c^-$ 设置为10相比相等正则化显著提升了不平衡网络上的AUC,证明了对不平衡问题的有效处理。
  • 模型能自动学习到一个稳定数量的潜在特征,且在多次独立运行中方差极低,表明对初始化具有鲁棒性。
  • 随机变体(stoDLFRM l)在所有数据集上均取得最佳AUC表现,优于所有基线方法,包括基于邻近度的方法和其他LFRM模型。
  • 对角线变体(diagDLFRM l)因特征维度K的线性缩放,训练时间显著减少,同时保持了具有竞争力的性能。
  • 该方法可扩展至包含最多10万实体和100万+链接的网络,其规模远超以往LFRM模型所能处理的范围。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。