Skip to main content
QUICK REVIEW

[論文レビュー] Catching the head, tail, and everything in between: a streaming algorithm for the degree distribution

Olivia Simpson, C. Seshadhri|arXiv (Cornell University)|Jun 8, 2015
Complex Network Analysis Techniques参考文献 32被引用数 6
ひとこと要約

本稿では、サブリニアなストレージを用いて大規模グラフの補完的累積次数ヒストグラム(ccdh)を正確に推定するストリーミングアルゴリズムheadtailを提案する。頻度の高い次数に対しては均一な頂点サンプリングを、まれで高次元の頂点に対しては切断幾何確率変数に基づく新規推定法を組み合わせることで、あらゆる次数スケールで高い正確性を達成した。ストリームサイズの1%未満のストレージでRH距離が0.1未塔を示し、従来手法でさえもはるかに多くのメモリを要する状況においても優れた性能を発揮した。

ABSTRACT

The degree distribution is one of the most fundamental graph properties of interest for real-world graphs. It has been widely observed in numerous domains that graphs typically have a tailed or scale-free degree distribution. While the average degree is usually quite small, the variance is quite high and there are vertices with degrees at all scales. We focus on the problem of approximating the degree distribution of a large streaming graph, with small storage. We design an algorithm headtail, whose main novelty is a new estimator of infrequent degrees using truncated geometric random variables. We give a mathematical analysis of headtail and show that it has excellent behavior in practice. We can process streams will millions of edges with storage less than 1% and get extremely accurate approximations for all scales in the degree distribution. We also introduce a new notion of Relative Hausdorff distance between tailed histograms. Existing notions of distances between distributions are not suitable, since they ignore infrequent degrees in the tail. The Relative Hausdorff distance measures deviations at all scales, and is a more suitable distance for comparing degree distributions. By tracking this new measure, we are able to give strong empirical evidence of the convergence of headtail.

研究の動機と目的

  • すべての次数スケールにわたり、大規模グラフの次数分布を高精度に推定できる、小規模なストレージと1パスのストリーミングアルゴリズムを設計すること。
  • 限られたストレージの制約のもとで、頻度の高い低次元頂点とまれな高次元頂点の両方を一様な正確性で推定する課題に対処すること。
  • テール部や重たいテールを持つ次数分布の比較に適した、相対ハウスドルフ距離(Relative Hausdorff distance)という新しい距離尺度を導入すること。
  • さまざまなストリーム順序と実世界のグラフワークロード下で、アルゴリズムの収束性と頑健性を実験的に検証すること。

提案手法

  • 低次元頂点は多数存在するため、$d_{\text{thr}}$ 以下の次数に対しては均一な頂点サンプリングを用い、容易にサンプリング可能であることを活用する。
  • 高次元頂点($d_{\text{thr}}$ 以上の次数)に対しては、希少な高次元次数のカウントを効率的に推定するための、切断幾何確率変数に基づく新規推定法を採用する。
  • 特に重たいテール領域における次数分布の乖離を定量化するため、相対ハウスドルフ距離を新しい指標として導入する。
  • 次数スペクトル全体にわたり、メモリ使用量と推定精度を制御するため、動的にサンプリング確率 $p_h$ と $p_t$ をバランスさせる。
  • 固定式による $d_{\text{thr}}$ を用いて、ヘッド推定器とテイル推定器を組み合わせ、各データセットごとの交差検証やチューニングを回避する。
  • 実世界のグラフ(as-Skitter, com-LiveJournal, com-Orkut)を用いて、サイズや次数分布の異なる複数のデータセットで手法を評価する。

実験結果

リサーチクエスチョン

  • RQ11パスのストリーミングアルゴリズムが、最小限のストレージで、低次元、中間次元、高次元のあらゆるスケールにおいて、次数分布の高精度推定を達成できるか。
  • RQ2限られたメモリの制約のもとで、ストリーミング環境下で希少な高次元頂点を正確に推定するにはどうすればよいか。
  • RQ3相対ハウスドルフ距離は、重たいテールを持つ次数分布の比較において、標準的な分布距離よりも適しているか。
  • RQ4アルゴリズムの性能は、敵対的または構造的なストリーム順序に対しても頑健であるか。
  • RQ5他の手法(例:ヘッド推定器+頻度、スペースセーブ、ロスレスカウント)をハイブリッドに組み合わせた手法ですら、はるかに多くのメモリを要する状況でも、headtailはそれを上回る性能を示せるか。

主な発見

  • as-Skitterグラフ(1,100万エッジ、170万頂点)において、headtailは31KBのストレージで相対ハウスドルフ(RH)距離が0.1未塔を達成した。
  • 31KBのストレージで、headtailはヘッド推定器と他のアルゴリズム(例:頻度、スペースセーブ、ロスレスカウント)をハイブリッドに組み合わせた手法を上回ったが、それらは同等のRH距離を達成するため150KBを超えるストレージを要した。
  • 異なるストリーム順序に対して、headtailのRH距離は安定しており、標準偏差がたった0.009にとどまり、入力順序の変化に対して頑健であることが示された。
  • 比較対象のハイブリッド手法が50KBのストレージと最適なしきい値選択が可能であったとしても、それぞれRH距離は0.33(頻度)、0.5(スペースセーブ)、1.5(ロスレスカウント)であり、headtailの0.1に比べて著しく劣っていた。
  • 実世界のグラフにおける可視化比較から、headtailのccdh推定値は、すべての次数スケールで真値に極めて近いことが確認された。ストレージが1%未塔の状況でも同様の結果が得られた。
  • 切断幾何確率変数の使用により、各頂点の次数を明示的に追跡する必要なく、希少で高次元の頂点の推定が正確に行えるようになった。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。