Skip to main content
QUICK REVIEW

[논문 리뷰] Sublinear-Time Algorithms for Counting Star Subgraphs with Applications to Join Selectivity Estimation

Aliakbarpour, Maryam, Biswas, Amartya Shankha|arXiv (Cornell University)|2016. 01. 17.
Distributed systems and fault tolerance참고 문헌 36인용 수 5
한 줄 요약

이 논문은 간선을 균일하게 샘플링하는 방식으로 그래프 내 p-스타 부분그래프의 수를 추정하고, 데이터베이스에서 자기조인 및 일치조인 쿼리의 선택도를 추정하기 위한 하위선형 시간 알고리즘을 제시한다. 이는 이전에 정점 샘플링에 의존한 방법보다 유의하게 향상된 쿼리 복잡도 $\tilde{O}(m \log \log n / (\varepsilon^2 S_p^{1/p}))$ 를 달성하며, 요아 원리와 결합된 간선 쿼리가 서로 유사한 그래프 구조를 이용한 명시적 그래프 구성으로 거의 날카로운 하한을 확립한다.

ABSTRACT

We study the problem of estimating the value of sums of the form $S_p riangleq \sum \binom{x_i}{p}$ when one has the ability to sample $x_i \geq 0$ with probability proportional to its magnitude. When $p=2$, this problem is equivalent to estimating the selectivity of a self-join query in database systems when one can sample rows randomly. We also study the special case when $\{x_i\}$ is the degree sequence of a graph, which corresponds to counting the number of $p$-stars in a graph when one has the ability to sample edges randomly. Our algorithm for a $(1 \pm \varepsilon)$-multiplicative approximation of $S_p$ has query and time complexities $Ø(\frac{m \log \log n}{ε^2 S_p^{1/p}})$. Here, $m=\sum x_i/2$ is the number of edges in the graph, or equivalently, half the number of records in the database table. Similarly, $n$ is the number of vertices in the graph and the number of unique values in the database table. We also provide tight lower bounds (up to polylogarithmic factors) in almost all cases, even when $\{x_i\}$ is a degree sequence and one is allowed to use the structure of the graph to try to get a better estimate. We are not aware of any prior lower bounds on the problem of join selectivity estimation. For the graph problem, prior work which assumed the ability to sample only \emph{vertices} uniformly gave algorithms with matching lower bounds [Gonen, Ron, and Shavitt. extit{SIAM J. Comput.}, 25 (2011), pp. 1365-1411]. With the ability to sample edges randomly, we show that one can achieve faster algorithms for approximating the number of star subgraphs, bypassing the lower bounds in this prior work. For example, in the regime where $S_p\leq n$, and $p=2$, our upper bound is $ ilde{O}(n/S_p^{1/2})$, in contrast to their $Ω(n/S_p^{1/3})$ lower bound when no random edge queries are available.

연구 동기 및 목표

  • 간선을 균일하게 샘플링할 수 있을 때 그래프 내 p-스타 부분그래프의 수를 추정하기 위한 효율적인 하위선형 시간 알고리즘을 설계하는 것.
  • 이 알고리즘을 활용하여 최소한의 데이터 접근으로 데이터베이스 시스템에서 자기조인 및 일치조인 쿼리의 선택도를 추정하는 것.
  • 균일한 간선 샘플링 하에서 $S_p = \sum \binom{x_i}{p}$ 를 추정하기 위한 쿼리 복잡도에 대해 거의 날카로운 하한을 확립하는 것, 특히 그래프 구조를 활용한 경우에도 마찬가지로 적용된다.
  • 간선 샘플링이 정점 샘플링만을 사용하는 기존 방법보다 더 빠른 추정을 가능하게 하여 문헌에서 기존 하한을 우회할 수 있음을 보여주는 것.
  • 유도된 그래프에서 길이 2의 경로 수를 세는 복잡도를 분석하여, 진입도/출구도 비율이 유한할 경우 하위선형 알고리즘이 가능함을 보여주는 것.

제안 방법

  • 주로 균일한 랜덤 간선 샘플링을 쿼리 원천으로 활용하여 $x_i$가 도수 또는 차수일 때 $S_p = \sum \binom{x_i}{p}$ 를 효율적으로 추정한다.
  • 쿼리 및 시간 복잡도가 $\tilde{O}(m \log \log n / (\varepsilon^2 S_p^{1/p}))$ 인 하위선형 추정기 알고리즘을 설계한다. 여기서 $m$ 은 간선 수이고 $S_p$ 는 목표 합계이다.
  • 요아 원리를 적용하여 두 그래프 가족 $\mathcal{F}_1$ 과 $\mathcal{F}_2$ 를 구성함으로써 하한을 증명한다. 이들은 $S_p$ 값이 다르지만 랜덤 간선 쿼리에서는 구분이 불가능하다.
  • 결합 논증을 사용하여 두 그래프 가정에서 랜덤 간선 쿼리가 높은 확률로 동일한 간선을 반환하도록 보장함으로써, 어떤 알고리즘도 이를 구분하기 위해 많은 쿼리를 수행해야 한다고 강제한다.
  • 진입도/출구도 비율이 유한할 경우 유도 그래프에서의 경로 수 계산 문제를 무방향 경우로 환원함으로써 하위선형 알고리즘을 가능하게 한다.
  • 자기순환과 다중 간선 문제를 피하기 위해 명시적인 인접 리스트 표현을 사용한다.

실험 결과

연구 질문

  • RQ1균일한 랜덤 간선 쿼리만을 사용하여 그래프 내 p-스타 부분그래프의 수를 추정할 수 있으며, 그 효율성은 어떠한가?
  • RQ2특히 조인 선택도 추정의 맥락에서, 간선 샘플링 대비 정점 샘플링을 사용할 경우 $S_p = \sum \binom{x_i}{p}$ 를 추정하는 데 복잡도는 어떻게 비교되는가?
  • RQ3랜덤 간선 쿼리를 사용할 때 $S_p$ 를 추정하는 데 정보 이론적 한계(하한)는 무엇이며, 이는 이전 연구와 어떻게 비교되는가?
  • RQ4유도 그래프에서 길이 2의 경로 수를 하위선형 시간 내에 추정할 수 있는 조건은 무엇인가?
  • RQ5간선 샘플링이 가능할 경우, 정점 샘플링 대비 그래프 구조를 활용하여 더 낮은 쿼리 복잡도를 달성할 수 있는가?

주요 결과

  • 제안된 알고리즘은 $\tilde{O}(m \log \log n / (\varepsilon^2 S_p^{1/p}))$ 의 쿼리 복잡도를 달성하며, 이는 입력 크기 대비 하위선형인 동시에 다항로그 인자 외에는 최적이다.
  • $S_p \leq n$ 이고 $p=2$ 인 경우, 알고리즘은 $\tilde{O}(n / S_p^{1/2})$ 시간 내에 실행되며, 이는 이전 연구에서 정점 샘플링만을 사용한 $\Omega(n / S_p^{1/3})$ 하한보다 향상된 결과이다.
  • $S_p = O(n^p)$ 인 경우, $\Omega(n^{1-1/p})$ 의 하한을 확립하여 알고리즘의 복잡도가 이 영역에서 거의 최적임을 보여준다.
  • $S_p = \Omega(n^p)$ 인 큰 경우, 하한은 $\Omega(n^{p-1/p} / S_p^{1-1/p})$ 로, 이는 알고리즘의 복잡도와 로그 인자 외에는 정확히 일치한다.
  • 일반적으로 유도 그래프에서 길이 2의 경로 수를 하위선형 시간 내에 계산할 수는 없지만, 진입도/출구도 비율이 유한할 경우 가능해진다.
  • 저자들은 조인 선택도 추정에 대해 알려진 바 없는 첫 번째 하한을 제시하며, 간선 샘플링이 정점 샘플링만을 사용하는 것보다 증명 가능하게 더 빠른 추정을 가능하게 함을 보였다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.