Skip to main content
QUICK REVIEW

[논문 리뷰] On Sampling from Massive Graph Streams

Nesreen K. Ahmed, Nick Duffield|arXiv (Cornell University)|2017. 03. 07.
Data Stream Mining Techniques참고 문헌 34인용 수 9
한 줄 요약

이 논문은 대규모 그래프 스트림에서 간선 샘플링과 부분그래프 추정을 분리하는 새로운 순서 기반 레저보어 샘플링 프레임워크인 그래프 우선순위 샘플링(gps)을 소개한다. 보조 변수를 사용해 간선을 적응적으로 가중치를 부여함으로써, 부분그래프 수 추정의 분산을 최소화한다. 삼각형과 와이드(와이드) 수 추정에서 <1% 오차를 달성하면서도, 간선의 극소수(예: 2억 6천만 간선의 트위터 그래프에 대해 4만 개)만 저장함으로써 놀라운 메모리 효율성을 확보한다.

ABSTRACT

We propose Graph Priority Sampling (GPS), a new paradigm for order-based reservoir sampling from massive streams of graph edges. GPS provides a general way to weight edge sampling according to auxiliary and/or size variables so as to accomplish various estimation goals of graph properties. In the context of subgraph counting, we show how edge sampling weights can be chosen so as to minimize the estimation variance of counts of specified sets of subgraphs. In distinction with many prior graph sampling schemes, GPS separates the functions of edge sampling and subgraph estimation. We propose two estimation frameworks: (1) Post-Stream estimation, to allow GPS to construct a reference sample of edges to support retrospective graph queries, and (2) In-Stream estimation, to allow GPS to obtain lower variance estimates by incrementally updating the subgraph count estimates during stream processing. Unbiasedness of subgraph estimators is established through a new Martingale formulation of graph stream order sampling, which shows that subgraph estimators, written as a product of constituent edge estimators are unbiased, even when computed at different points in the stream. The separation of estimation and sampling enables significant resource savings relative to previous work. We illustrate our framework with applications to triangle and wedge counting. We perform a large-scale experimental study on real-world graphs from various domains and types. GPS achieves high accuracy with less than 1% error for triangle and wedge counting, while storing a small fraction of the graph with average update times of a few microseconds per edge. Notably, for a large Twitter graph with more than 260M edges, GPS accurately estimates triangle counts with less than 1% error, while storing only 40K edges.

연구 동기 및 목표

  • 정확한 계산이 불가능한 대규모 고속도 그래프 스트림에서 그래프 성질을 효율적으로 추정하는 문제에 대응한다.
  • 기존 샘플링 방법의 한계를 극복한다. 고정된 설계, 보조 정보에 대한 적응성 부족, 특정 부분그래프 유형에 대한 추정 분산 최소화 불가능성 등의 문제를 해결한다.
  • 샘플링 과정과 부분그래프 추정을 분리함으로써, 유연하고 증분적이고 편향이 없는 추정을 최소한의 메모리로 가능하게 한다.
  • 모든 종류의 부분그래프 쿼리에 대해 스트림 이후 및 스트림 중 추정을 지원하는 일반 목적의 프레임워크를 제공한다.

제안 방법

  • 하나의 부분그래프 추정기의 분산을 최소화하기 위해 보조 변수나 크기 변수를 기반으로 간선 샘플링 확률을 할당하는 우선순위 기반 레저보어 샘플링 기법인 그래프 우선순위 샘플링(gps)을 제안한다.
  • 두 가지 추정 프레임워크를 도입한다: 참조 샘플에 대한 후행 쿼리용 Post-Stream 추정, 스트림 처리 중 실시간으로 낮은 분산 업데이트를 위한 In-Stream 추정.
  • 새로운 마팅게일 형식을 사용해 부분그래프 추정기의 비편향성을 입증한다. 이는 다양한 스트림 시간에 계산된 간선 추정기의 곱이 여전히 비편향임을 증명한다.
  • 샘플링과 추정의 분리를 활용해 자원 사용을 줄이며, 중복 계산을 방지하고 효율적인 증분 업데이트를 가능하게 한다.
  • 목표 부분그래프(예: 삼각형, 와이드)에 기여도가 높은 간선이 우선순위가 되도록 간선 샘플링 가중치를 설계함으로써, 최종 추정의 총 분산을 최소화한다.
  • 부분그래프 수 추정을 간선 수준 추정기의 곱으로 공식화하며, 정확한 불확실성 정량화를 위해 분산 및 공분산 항목을 명시적으로 모델링한다.

실험 결과

연구 질문

  • RQ1대규모 그래프 스트림에서 부분그래프 수 추정의 분산을 최소화하면서도 비편향성을 유지하는 샘플링 프레임워크를 어떻게 설계할 수 있는가?
  • RQ2샘플링 과정을 부분그래프 추정에서 분리함으로써 효율성을 향상시키고, 후행 분석과 실시간 분석을 모두 가능하게 할 수 있는가?
  • RQ3다른 스트림 시간에 계산된 부분그래프 추정기가 비편향임을 보장하는 이론적 기반은 무엇인가?
  • RQ4보조 변수나 크기 변수에 기반한 간선 샘플링 가중치는 부분그래프 수 추정의 정확도와 분산에 어떤 영향을 미치는가?
  • RQ530억 개 이상의 간선을 가진 실세계 그래프에 대해 이 프레임워크는 높은 정확도와 낮은 메모리 사용량을 유지하면서 얼마나 스케일링 가능한가?

주요 결과

  • gps는 실세계 그래프, 특히 2억 6천만 개 이상의 간선을 가진 대규모 트위터 그래프에서 삼각형 및 와이드 수 추정에서 <1% 오차를 달성한다.
  • 동일한 트위터 그래프에서 gps는 단지 4만 개의 간선만 저장하면서도 삼각형 수 추정에서 <1% 오차를 기록하여 놀라운 메모리 효율성을 입증한다.
  • 간선당 평균 업데이트 시간은 수 마이크로초에 불과하여 대규모 스케일의 실시간 처리가 가능하다.
  • Post-Stream 및 In-Stream 추정 모두 지원되며, 후자의 경우 증분 업데이트를 통해 더 낮은 분산을 달성한다.
  • 이론적 분석을 통해 마팅게일 기반의 새로운 형식 덕분에, 다양한 스트림 시간에 계산된 부분그래프 추정기가 여전히 비편향임을 확인한다.
  • 공분산 항목은 부분그래프가 간선을 공유할 경우에만 비영이 되며, 이 프레임워크는 이러한 항목을 명시적으로 모델링하여 정확한 불확실성 정량화를 보장한다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.