Skip to main content
QUICK REVIEW

[论文解读] Link prediction for partially observed networks

Yunpeng Zhao, Elizaveta Levina|arXiv (Cornell University)|Jan 29, 2013
Bioinformatics and Genomic Networks被引用 6
一句话总结

本文提出了一种针对部分观测网络的半监督链路预测方法,将观测到的链路与非链路视为真实网络的噪声样本,利用节点协变量和网络拓扑对潜在链路进行排序。该方法在稀疏或噪声较大的设置下优于现有方法,通过建模链路观测中的不确定性,而无需已知的负样本。

ABSTRACT

Link prediction is one of the fundamental problems in network analysis. In many applications, notably in genetics, a partially observed network may not contain any negative examples of absent edges, which creates a difficulty for many existing supervised learning approaches. We develop a new method which treats the observed network as a sample of the true network with different sampling rates for positive and negative examples. We obtain a relative ranking of potential links by their probabilities, utilizing information on node covariates as well as on network topology. Empirically, the method performs well under many settings, including when the observed network is sparse. We apply the method to a protein-protein interaction network and a school friendship network.

研究动机与目标

  • 解决在负样本(非边)不确定或缺失的网络中进行链路预测的挑战,特别是在生物网络中。
  • 开发一种无需已知负样本的方法,克服标准监督学习方法的关键局限。
  • 基于估计的概率,对潜在链路(包括已观测到的边和未观测到的边)提供相对排序,适用于优先进行实验验证。
  • 结合节点层面的协变量和网络结构信息,以在部分可观测条件下提高预测准确性。
  • 通过将链路观测误差建模为真实正例和负例的未知但不同的分布,确保对采样噪声和稀疏性的鲁棒性。

提出的方法

  • 将观测网络建模为真实网络的噪声样本,其中真实边(α)和非边(β)的采样率未知。
  • 提出一种结合节点相似性矩阵 W 与观测网络结构的半监督链路排序准则,以估计链路概率。
  • 使用块坐标下降算法优化非参数化排序准则,通过交叉验证选择正则化参数 λ。
  • 当协变量不可用时,使用节点协变量(例如基因表达、蛋白质定位)或基于网络的度量(例如 Jaccard 指数)定义相似性矩阵 W。
  • 制定两种排序准则:完整求和准则和部分求和准则,两者均旨在根据估计的链路概率对节点对进行排序。
  • 通过仅假设相似节点具有相似的链路概率,实现灵活且无需模型假设的推理,无需假设特定的网络生成模型。

实验结果

研究问题

  • RQ1当负样本不确定或缺失时(如许多生物网络中),如何实现可靠的链路预测?
  • RQ2当仅获得部分网络信息时,半监督方法是否能优于纯无监督或完全监督方法?
  • RQ3所提出方法的性能如何随采样率和网络稀疏性而变化?
  • RQ4在部分观测网络中,节点协变量和网络拓扑在多大程度上共同提升链路预测准确性?
  • RQ5当真实网络结构因缺失或虚假边而失真时,该方法是否仍能提供稳健的排序?

主要发现

  • 在蛋白质-蛋白质相互作用网络中,所提出的半监督准则在不同采样率(α = 0.2, 0.5, 0.8)下始终优于无监督准则和潜在变量模型。
  • 潜在变量模型表现不如所提方法,尤其在低采样率(α = 0.2)时,因其对稀疏观测引起的拓扑失真敏感。
  • 在学校友谊网络中,两种所提准则在 α = 0.8 和 α = 0.5 时表现良好,但在 α = 0.2 时失败,表明当网络过于稀疏时,基于网络的相似性 W 失去有效性。
  • 由于节点相似性矩阵 W 是基于协变量构建的,因此该方法在不同采样率下表现稳定,不受子采样影响,而基于拓扑的 W 则受影响。
  • 该方法即使在缺乏已知负样本的情况下,也能提供可靠的潜在链路相对排序,适用于高成本环境下的实验验证优先级排序。
  • 由于对不确定性的稳健处理,该方法在 ROC-AUC 上优于现有方法,尤其在假阳性和假阴性率较高的场景下表现更优。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。