Skip to main content
QUICK REVIEW

[논문 리뷰] Tracking Top-K Influential Vertices in Dynamic Networks

Yang Yu, Zhefeng Wang|arXiv (Cornell University)|2018. 03. 05.
Data Stream Mining Techniques참고 문헌 10인용 수 3
한 줄 요약

이 논문은 선형 임계치(LT) 및 독립 확산(IC) 모델 하에서 동적 네트워크에서 상위-k 영향력 있는 정점들을 스케일러블하고 증명 가능한 정확도로 추적하는 방법을 제안한다. 무작위 RR 집합의 샘플을 유지하고, 두 개의 O(1)-시간 신호를 사용해 RR 집합 수를 동적으로 조정함으로써, 곱셈 오차 보장을 확보하고 이전 작업 대비 영향력 최대화 쿼리에서 최대 10배 빠른 성능 향상을 달성한다.

ABSTRACT

Influence propagation in networks has enjoyed fruitful applications and has been extensively studied in literature. However, only very limited preliminary studies tackled the challenges in handling highly dynamic changes in real networks. In this paper, we tackle the problem of tracking top-$k$ influential vertices in dynamic networks, where the dynamic changes are modeled as a stream of edge weight updates. Under the popularly adopted linear threshold (LT) model and the independent cascade (IC) model, we address two essential versions of the problem: tracking the top-$k$ influential individuals and finding the best $k$-seed set to maximize the influence spread (Influence Maximization). We adopt the polling-based method and maintain a sample of random RR sets so that we can approximate the influence of vertices with provable quality guarantees. It is known that updating RR sets over dynamic changes of a network can be easily done by a reservoir sampling method, so the key challenge is to efficiently decide how many RR sets are needed to achieve good quality guarantees. We use two simple signals, which both can be accessed in $O(1)$ time, to decide a proper number of RR sets. We prove the effectiveness of our methods. For both tasks the error incurred in our method is only a multiplicative factor to the ground truth. For influence maximization, we also propose an efficient query algorithm for finding the $k$ seeds, which is one order of magnitude faster than the state-of-the-art query algorithm in practice. In addition to the thorough theoretical results, our experimental results on large real networks clearly demonstrate the effectiveness and efficiency of our algorithms.

연구 동기 및 목표

  • 실시간 간선 가중치 업데이트가 지속적으로 발생하는 대규모 고도로 동적인 네트워크에서 상위-k 영향력 있는 정점들을 추적하는 문제에 대응하기 위해.
  • LT 및 IC 모델 하에서 영향력 추정 및 시드 세트 선택에 대해 증명 가능한 품질 보장을 제공하기 위해.
  • 절대 임계치 대신 상대 오차 기반 임계치를 사용함으로써 네트워크 성질에 대한 사전 지식이 필요 없도록 하기 위해.
  • 최소한의 RR 집합 수를 유지하면서도 높은 정확도를 확보하는 효율적이고 확장 가능한 알고리즘을 설계하기 위해.
  • 샘플된 RR 집합 기반에서 그린드 시드 선택 과정을 최적화해 영향력 최대화 쿼리 속도를 향상시키기 위해.

제안 방법

  • 무작위 역도달 가능(RR) 집합을 사용한 투표 기반 접근 방식을 통해 정점의 영향력을 증명 가능한 정확도로 근사한다.
  • 동적 간선 가중치 변화에 대응해 RR 집합을 효율적으로 갱신하기 위해 리저보어 샘플링을 적용한다.
  • 필요한 오차 한계를 확보하기 위해 최적의 RR 집합 수를 결정하는 데 O(1)-시간 신호 두 개를 도입한다.
  • 영향력 확산 함수의 역수를 사용해 RR 집합 크기에 대한 이론적 경계를 적용함으로써 곱셈 오차 보장을 확보한다.
  • 중복 계산을 줄임으로써 영향력 최대화를 가속화하는 새로운 그린드 쿼리 알고리즘(New Greedy)을 제안한다.
  • 이론적 경계에 기반한 실용적인 히ュ리스틱 샘플 크기를 사용해 정확도와 효율성을 실생활에서 균형 잡는다.

실험 결과

연구 질문

  • RQ1지속적인 간선 업데이트가 발생하는 동적 네트워크에서 상위-k 영향력 있는 정점에 대한 정확한 영향력 추정을 유지하는 방법은 무엇인가?
  • RQ2원하는 상대 오차를 확보하기 위해 필요한 RR 집합 수를 결정하는 가벼운, 효율적인 방법은 무엇인가?
  • RQ3기존 방법에 비해 훨씬 빠르면서도 해의 품질을 유지하는 영향력 최대화를 위한 쿼리 알고리즘을 설계할 수 있는가?
  • RQ4제안된 방법은 LT 및 IC 영향력 전파 모델 하에서 대규모 실세계 동적 네트워크에서 어떻게 확장 가능한가?
  • RQ5정확도를 희생시키지 않고 RR 집합 수를 얼마나 줄일 수 있는가?

주요 결과

  • 제안된 방법은 네트워크에 대한 사전 지식 없이도 진짜 영향력에 대한 상대 오차가 곱셈 인자로 제한됨을 보장한다.
  • Ohsaka 등 [20]의 최신 기술 대비 최대 10배 적은 RR 집합 수를 유지함으로써 공간 효율성을 크게 향상시킨다.
  • New Greedy 쿼리 알고리즘은 [20]의 Lazy Evaluation 방법 대비 최대 10배 빠르게 동작하며, 트위터 네트워크에서 300ms 이내에 결과를 도출한다.
  • 가장 큰 데이터셋(Twitter)에서 0.3억 건의 업데이트를 4시간 이내에 처리해 강력한 확장성을 입증했다.
  • 이론적 경계에 기반한 실용적 샘플 크기 히ュ리스틱은 실생활에서 효과적으로 작동하며, 최소한의 RR 집합으로도 높은 정확도를 유지한다.
  • 실세계 네트워크에서 영향력 추정의 상대 오차율이 최대 2% 이내로 확인되었으며, 실험적 평가를 통해 검증되었다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.