Skip to main content
QUICK REVIEW

[논문 리뷰] Supervised and Extended Restart in Random Walks for Ranking and Link Prediction in Networks

Woojeong Jin, Jinhong Jung|arXiv (Cornell University)|2017. 10. 18.
Complex Network Analysis Techniques참고 문헌 24인용 수 3
한 줄 요약

이 논문은 각 노드에 고유한 재시작 확률을 부여하여 순서 매기기 및 링크 예측에서 표현력을 향상시키는 개인화된 관련성 점수 방법인 확장된 재시작을 가진 랜덤 워크(RWER)를 제안한다. 또한 데이터로부터 최적의 재시작 확률을 자동으로 학습하는 지도 학습 알고리즘인 SuRe를 도입하여 링크 예측 과제에서 최고의 경쟁자 대비 최대 15.8% 높은 MAP를 달성한다.

ABSTRACT

Given a real-world graph, how can we measure relevance scores for ranking and link prediction? Random walk with restart (RWR) provides an excellent measure for this and has been applied to various applications such as friend recommendation, community detection, anomaly detection, etc. However, RWR suffers from two problems: 1) using the same restart probability for all the nodes limits the expressiveness of random walk, and 2) the restart probability needs to be manually chosen for each application without theoretical justification. We have two main contributions in this paper. First, we propose Random Walk with Extended Restart (RWER), a random walk based measure which improves the expressiveness of random walks by using a distinct restart probability for each node. The improved expressiveness leads to superior accuracy for ranking and link prediction. Second, we propose SuRe (Supervised Restart for RWER), an algorithm for learning the restart probabilities of RWER from a given graph. SuRe eliminates the need to heuristically and manually select the restart parameter for RWER. Extensive experiments show that our proposed method provides the best performance for ranking and link prediction tasks, improving the MAP (Mean Average Precision) by up to 15.8% on the best competitor.

연구 동기 및 목표

  • 기존의 랜덤 워크와 재시작(RWR)에서 고정된 재시작 확률로 인해 노드 관련성 측정의 표현력이 제한되는 문제를 해결한다.
  • RWR에서 히ュ리스틱적이고 수동적인 재시작 확률 선택이 필요로 하는 문제를 해결하기 위해 데이터 기반의 학습 방법을 개발한다.
  • 질의 노드가 서로 다른 재시작 확률을 통해 선호도를 표현할 수 있도록 하여 순서 매기기 및 링크 예측 정확도를 향상시킨다.
  • 과적합을 방지하면서도 실제 그래프에서 높은 성능을 유지하는 스케일러블하고 강력한 학습 알고리즘을 설계한다.

제안 방법

  • 각 노드가 고유한 재시작 확률을 가지는 RWR의 일반화인 RWER를 제안하여, 노드 특성에 기반한 랜덤 워크 행동에 대한 더 세밀한 제어를 가능하게 한다.
  • 개인화된 전이 행렬과 노드별 재시작 확률을 포함하는 선형 방정식계를 통해 관련성 점수 계산을 수식화한다.
  • 지표 링크 또는 순서 매기기 정보를 기반으로 하는 미분 가능한 목적 함수를 사용해 재시작 확률을 최적화하는 지도 학습 프레임워크인 SuRe를 도입한다.
  • 과적합을 방지하고 일반화 성능을 향상시키기 위해 SuRe에 원천 벡터를 정규화 요소로 통합한다. 특히 데이터가 적은 환경에서 효과가 뚜렷하다.
  • 소규모 배치 샘플링을 사용한 스트로스틱 최적화를 통해 SuRe를 대규모 그래프에 스케일링하며, 간선 수에 대해 근사 선형 시간 복잡도를 확보한다.
  • 하위 작업에서 예측 정확도를 최대화하도록 개인화된 랜덤 워크의 잠재력을 활용하여 재시작 확률을 학습한다.

실험 결과

연구 질문

  • RQ1각 노드에 고유한 재시작 확률를 할당하는 것이 그래프 기반의 관련성 점수 측정에서 표현력과 정확도를 향상시키는가?
  • RQ2그래프 구조를 수정하지 않고도 재시작 확률를 데이터로부터 자동으로 학습할 수 있는 방법은 무엇인가? 기존의 히ュ리스틱적 또는 고정 파rameter 접근 방식을 능가하는가?
  • RQ3제안된 SuRe 방법은 링크 예측 및 노드 순서 매기기와 같은 다양한 그래프 유형과 작업에 대해 잘 일반화되는가?
  • RQ4SuRe에서 원천 벡터 정규화가 모델 안정성과 일반화 성능에 미치는 영향은 무엇인가?
  • RQ5대규모 네트워크에서 SuRe의 확장성은 기존의 학습 기반 및 전통적인 RWR 방법과 비교해 어떻게 되는가?

주요 결과

  • SuRe는 링크 예측 과제에서 최고의 기존 방법 대비 최대 15.8% 향상된 평균 평균 정밀도(MAP)를 기록한다.
  • SuRe는 최고의 경쟁자 대비 Precision@20에서 최대 10.1% 향상되어 상위-k 순서 매기기에서 뛰어난 성능을 입증한다.
  • SuRe에 원천 벡터를 포함시킴으로써 성능 향상과 과적합 감소가 뚜렷하게 나타나며, 특히 데이터가 적은 환경에서 유의미한 효과가 있다.
  • SuRe는 간선 수에 대해 근사 선형으로 확장되며 기울기 0.76를 보이며, SRW 및 QUINT와 같은 다른 학습 기반 방법보다 효율성이 뛰어나다.
  • 학습된 재시작 확률를 가진 RWER는 모든 평가된 데이터셋과 과제에서 표준 RWR 및 기타 지도 학습 방법보다 일관되게 뛰어난 성능을 보인다.
  • 이 방법은 파rameter 선택에 대해 강건하며, Polblogs, HepTh, Wikipedia와 같은 다양한 데이터셋에서 안정적인 성능을 보인다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.