Skip to main content
QUICK REVIEW

[논문 리뷰] Catching the head, tail, and everything in between: a streaming algorithm for the degree distribution

Olivia Simpson, C. Seshadhri|arXiv (Cornell University)|2015. 06. 08.
Complex Network Analysis Techniques참고 문헌 32인용 수 6
한 줄 요약

이 논문은 대규모 그래프의 보완 누적도수 히스토GRAM(cecdh)를 하위선형 저장공간을 사용하여 정확하게 추정하는 스트리밍 알고리즘 headtail을 제시한다. 빈도수가 높은 도수의 경우 균일한 정점 샘플링을, 희귀한 고도수 정점의 경우 도색된 기하확률변수를 기반으로 한 새로운 추정기법을 조합함으로써 headtail은 모든 도수 척도에서 높은 정확도를 달성한다. 저장공간이 스트림 크기의 1% 미만이어도 RH 거리가 0.1 미만이며, 기존 방법들조차도 훨씬 더 많은 메모리를 사용함에도 불구하고 이를 뛰어넘는다.

ABSTRACT

The degree distribution is one of the most fundamental graph properties of interest for real-world graphs. It has been widely observed in numerous domains that graphs typically have a tailed or scale-free degree distribution. While the average degree is usually quite small, the variance is quite high and there are vertices with degrees at all scales. We focus on the problem of approximating the degree distribution of a large streaming graph, with small storage. We design an algorithm headtail, whose main novelty is a new estimator of infrequent degrees using truncated geometric random variables. We give a mathematical analysis of headtail and show that it has excellent behavior in practice. We can process streams will millions of edges with storage less than 1% and get extremely accurate approximations for all scales in the degree distribution. We also introduce a new notion of Relative Hausdorff distance between tailed histograms. Existing notions of distances between distributions are not suitable, since they ignore infrequent degrees in the tail. The Relative Hausdorff distance measures deviations at all scales, and is a more suitable distance for comparing degree distributions. By tracking this new measure, we are able to give strong empirical evidence of the convergence of headtail.

연구 동기 및 목표

  • 모든 도수 척도에서 대규모 그래프의 도수 분포를 정확하게 추정할 수 있는 소형 스토리지, 일회성 스트리밍 알고리즘을 설계하는 것.
  • 제한된 저장공간에도 불구하고 빈번한 저도수 정점과 희귀한 고도수 정점 모두를 균일한 정확도로 추정하는 과제를 해결하는 것.
  • 꼬리가 두꺼운 또는 무거운 꼬리 분포의 도수 분포를 비교하는 데 적합한 새로운 거리 척도인 상대 허스도르 거리(Relative Hausdorff distance)를 도입하는 것.
  • 다양한 스트림 순서와 실제 그래프 워크로드 하에서 알고리즘의 수렴성과 강건성을 실증적으로 검증하는 것.

제안 방법

  • 저도수 정점은 낮은 도수 정점이 풍부하고 쉽게 샘플링될 수 있다는 사실을 활용하여 임계값 $d_{\text{thr}}$ 이하의 도수에 대해 균일한 정점 샘플링을 사용한다.
  • 임계값 $d_{\text{thr}}$ 초과의 도수에 대해서는 도색된 기하확률변수를 기반으로 한 새로운 추정기법을 사용하여 희귀한 고도수 정점의 수를 효율적으로 추정한다.
  • 특히 꼬리가 두꺼운 영역에서의 도수 분포의 편차를 정량화하기 위해 상대 허스도르 거리를 새로운 척도로 도입한다.
  • 메모리 사용량과 도수 스펙트럼 전반의 추정 정확도를 제어하기 위해 샘플링 확률 $p_h$와 $p_t$를 동적으로 조정한다.
  • 임계도수 $d_{\text{thr}}$에 대해 고정된 공식을 사용하여 헤드와 테일 추정기법을 조합함으로써 각 데이터셋에 대한 비용이 많이 드는 교차검증이나 튜닝을 피한다.
  • 크기와 도수 분포가 다른 실제 그래프(as-Skitter, com-LiveJournal, com-Orkut)를 사용하여 방법을 평가한다.

실험 결과

연구 질문

  • RQ1일관된 스트리밍 알고리즘이 최소한의 저장공간을 사용하여 저도수, 중간도수, 고도수를 포함한 모든 척도에서 도수 분포를 고정확도로 추정할 수 있는가?
  • RQ2제한된 메모리 환경에서 스트리밍 환경에서 희귀한 고도수 정점의 추정을 어떻게 정확하게 수행할 수 있는가?
  • RQ3상대 허스도르 거리가 꼬리가 두꺼운 도수 분포를 비교하는 데 표준적인 분포 거리 척도보다 더 적합한가?
  • RQ4알고리즘의 성능은 악성 또는 구조화된 스트림 순서를 포함한 다양한 엣지 스트림 순서에 대해 강건한가?
  • RQ5기존 알고리즘의 하이브리드 조합(예: 헤드 추정기 + 빈번, 스페이스 세이빙, 로스리 카운팅)이 훨씬 더 많은 메모리를 사용함에도 불구하고 headtail이 그들을 능가할 수 있는가?

주요 결과

  • as-Skitter 그래프(1,100만 개의 엣지와 170만 개의 정점)에서 headtail은 31KB의 저장공간으로 상대 허스도르(RH) 거리가 0.1 이하를 달성한다.
  • 31KB의 저장공간을 사용할 때 headtail은 RH 거리가 유사한 결과를 내기 위해 150KB 이상이 필요한 헤드 추정기와 다른 알고리즘의 하이브리드 조합들(예: 빈번, 스페이스 세이빙, 로스리 카운팅)을 능가한다.
  • 다양한 스트림 순서에 걸쳐 headtail의 RH 거리는 안정적이며, 표준편차가 오직 0.009에 불과하여 입력 순서에 대한 강건성을 보여준다.
  • 경쟁하는 하이브리드 방법들이 50KB의 저장공간과 최적의 임계값 선택을 제공받았을 때도, RH 거리는 각각 0.33(frequent), 0.5(space saving), 1.5(lossy counting)였으며, headtail의 0.1보다 훨씬 열 劣하다.
  • 실제 그래프에서의 시각적 비교를 통해 headtail의 ccdh 추정치는 모든 도수 척도에서 진짜 값과 매우 가까운 것으로 나타났으며, 저장공간이 1% 미만일 때도 마찬가지였다.
  • 도색된 기하확률변수의 사용은 각 정점의 도수를 명시적으로 추적할 필요 없이 희귀한 고도수 정점의 추정을 정확하게 가능하게 한다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.