Skip to main content
QUICK REVIEW

[논문 리뷰] Link prediction for partially observed networks

Yunpeng Zhao, Elizaveta Levina|arXiv (Cornell University)|2013. 01. 29.
Bioinformatics and Genomic Networks인용 수 6
한 줄 요약

이 논문은 관측된 네트워크에서 관측된 간선과 비관측 간선을 진짜 네트워크의 노이즈 있는 샘플로 간주하고, 노드 공변량과 네트워크 구조를 이용해 잠재적 간선을 순위 매기는 준지도 기반 링크 예측 방법을 제안한다. 이 방법은 라벨이 부여된 음성 예외가 필요로 하지 않으며 간선 관측의 불확실성을 모델링함으로써, 기존 방법들보다 특히 희소하거나 노이즈가 많은 환경에서 뛰어난 성능을 보인다.

ABSTRACT

Link prediction is one of the fundamental problems in network analysis. In many applications, notably in genetics, a partially observed network may not contain any negative examples of absent edges, which creates a difficulty for many existing supervised learning approaches. We develop a new method which treats the observed network as a sample of the true network with different sampling rates for positive and negative examples. We obtain a relative ranking of potential links by their probabilities, utilizing information on node covariates as well as on network topology. Empirically, the method performs well under many settings, including when the observed network is sparse. We apply the method to a protein-protein interaction network and a school friendship network.

연구 동기 및 목표

  • 생물학적 네트워크에서와 같이 음성 예외(비간선)가 불확실하거나 존재하지 않는 네트워크에서 링크 예측의 과제를 해결한다.
  • 알려진 음성 예외가 필요로 하지 않는 방법을 개발하여, 표준 지도 학습 접근법의 핵심적 한계를 극복한다.
  • 관측된 간선이 있는지 여부에 관계없이 잠재적 간선의 상대적 순위를 추정된 확률 기반으로 제공하여 실험적 검증을 우선시하는 데 적합하다.
  • 부분 관측 조건에서 예측 정확도를 향상시키기 위해 노드 수준의 공변량과 네트워크 구조적 정보를 모두 통합한다.
  • 진짜 양성 및 음성 간선에 대해 각각 다른 알려지지 않은 관측 오차를 모델링하여 표본 노이즈와 희소성에 강건성을 확보한다.

제안 방법

  • 진짜 네트워크의 노이즈 있는 샘플로 관측된 네트워크를 모델링하며, 진짜 간선(α)과 비간선(β)에 대해 알려지지 않은 표본 추출 비율을 가진다.
  • 노드 유사도 행렬 W와 관측된 네트워크 구조를 조합하여 링크 확률을 추정하는 준지도 기반 링크 순위 기준을 제안한다.
  • 비모수적 순위 기준을 최적화하기 위해 블록 좌표 강하 알고리즘을 사용하며, 교차 검증을 통해 조정 파rameter λ를 선택한다.
  • 노드 공변량(예: 유전자 발현, 단백질 국소화)이 이용 가능한 경우 유사도 행렬 W를 정의하고, 공변량이 없을 경우 네트워크 기반 측정치(예: 자카르 지수)를 사용한다.
  • 전체 합 기준과 부분 합 기준이라는 두 가지 순위 기준을 제안하며, 모두 추정된 링크 확률에 따라 노드 쌍을 순위 매기도록 설계되어 있다.
  • 특정 네트워크 생성 모델을 가정하지 않고도 민감도가 높은 모델 자유형 추론을 가능하게 하며, 유사한 노드는 유사한 링크 확률을 가져야 한다는 가정에 기반한다.

실험 결과

연구 질문

  • RQ1생물학적 네트워크에서와 같이 음성 예외가 불확실하거나 존재하지 않는 상황에서 링크 예측을 어떻게 신뢰성 있게 수행할 수 있는가?
  • RQ2부분적으로만 관측된 네트워크 정보가 있을 때, 순수 무지도 학습 또는 완전 지도 학습 방법보다 준지도 접근이 더 나은 성능을 낼 수 있는가?
  • RQ3제안된 방법의 성능는 표본 추출 비율과 네트워크의 희소성에 따라 어떻게 변하는가?
  • RQ4노드 공변량과 네트워크 구조가 부분 관측 네트워크에서 링크 예측 정확도를 얼마나 함께 향상시키는가?
  • RQ5실제 네트워크의 구조가 누락되거나 잘못된 간선으로 인해 왜곡되어도 이 방법이 강건한 순위를 제공할 수 있는가?

주요 결과

  • 제안된 준지도 기반 기준은 단백질-단백질 상호작용 네트워크에서 다양한 표본 추출 비율(α = 0.2, 0.5, 0.8)에서 무지도 학습 기준 및 잠재 변수 모델을 항상 능가한다.
  • 잠재 변수 모델은 특히 낮은 표본 추출 비율(α = 0.2)에서 제안된 방법보다 성능이 열 劣하나, 희소한 관측으로 인한 구조적 왜곡에 민감하기 때문이다.
  • 학교 우정 네트워크에서는 α = 0.8 및 α = 0.5일 때 두 제안된 기준 모두 잘 작동하지만, α = 0.2일 땐 실패한다. 이는 네트워크 기반의 유사도 W가 네트워크가 너무 희소할 경우 효과를 잃기 때문이다.
  • 노드 유사도 행렬 W가 공변량에서 구성되기 때문에, 표본 추출에 영향을 받지 않으며, 이로 인해 표본 추출 비율이 변하더라도 성능이 안정적이다. 반면 구조 기반 W는 그렇지 않다.
  • 알려진 음성 예외가 없더라도 잠재적 간선의 신뢰할 수 있는 상대적 순위를 제공하므로, 높은 비용이 수반되는 실험적 검증을 우선시하는 데 적합하다.
  • 기존 방법들과 비교해 ROC-AUC 성능이 뛰어나며, 특히 고율의 거짓 양성 및 거짓 음성 비율이 존재하는 상황에서의 불확실성 처리 능력 덕분이다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.