Skip to main content
QUICK REVIEW

[論文レビュー] Slim Graph: Practical Lossy Graph Compression for Approximate Graph Processing, Storage, and Analytics

Maciej Besta, Simon Weber|arXiv (Cornell University)|Dec 18, 2019
Graph Theory and Algorithms参考文献 189被引用数 5
ひとこと要約

Slim Graph は、実用的な損失ありグラフ圧縮のための新しいプログラミングモデルおよびフレームワークを導入し、高速な近似グラフ処理、ストレージ削減、正確な分析を可能にします。プログラマブルな圧縮カーネルを用いて局所的なグラフ構造を変更し、連結成分やスペクトルといった重要な性質を保持しつつ、統計的乖離を用いて正確性を測定します。実世界のグラフにおいて、顕著な高速化とストレージ削減を実現しながらも、高い忠実度を維持しています。

ABSTRACT

We propose Slim Graph: the first programming model and framework for practical lossy graph compression that facilitates high-performance approximate graph processing, storage, and analytics. Slim Graph enables the developer to express numerous compression schemes using small and programmable compression kernels that can access and modify local parts of input graphs. Such kernels are executed in parallel by the underlying engine, isolating developers from complexities of parallel programming. Our kernels implement novel graph compression schemes that preserve numerous graph properties, for example connected components, minimum spanning trees, or graph spectra. Finally, Slim Graph uses statistical divergences and other metrics to analyze the accuracy of lossy graph compression. We illustrate both theoretically and empirically that Slim Graph accelerates numerous graph algorithms, reduces storage used by graph datasets, and ensures high accuracy of results. Slim Graph may become the common ground for developing, executing, and analyzing emerging lossy graph compression schemes.

研究の動機と目的

  • 膨大なグラフ(例:1兆エッジのデータセット)の格納と処理の増加する課題に対処し、パフォーマンスおよびストレージ最適化として損失あり圧縮を可能にすること。
  • 理論的ストレージ境界に近づくと圧縮コストが増大し、効果が薄れる損失なし圧縮の限界を克服すること。
  • 開発者が低レベルの並列プログラミングを必要とせず、新しい損失あり圧縮方式を実装および評価できる、実用的で拡張可能なフレームワークを提供すること。
  • さまざまなグラフ特性にわたる情報損失を評価する厳密なメトリクスを定義することで、近似グラフ分析における高い正確性を確保すること。
  • 多様なワークロードおよびグラフタイプにわたる損失ありグラフ圧縮手法の設計、実行、分析を統合的に支援するプラットフォームを確立すること。

提案手法

  • 局所的グラフ構造(例:エッジ、三角形)を操作する小型で合成可能な関数である「圧縮カーネル」に焦点を当てたプログラミングモデルを導入。
  • 開発者が低レベルの並列処理の詳細を意識せずに済むように、並列実行を管理するランタイムエンジンを採用。
  • 確率的グラフ特性における情報損失を定量化する統計的乖離(例:Kullback-Leibler 散乱)を用い、客観的な正確性評価を可能に。
  • 過去の手法を一般化し、最大基数マッチングなどの重要な性質を保持する、新しい圧縮方式「三角形削減(TR)」を適用。
  • スペクトル、最短経路、スパニングツリー、連結成分など、複数のグラフ特性を保持の対象としてサポート。
  • 理論的分析を用いて、保持される特性の境界(例:TR 後の最大基数マッチングのサイズは元の半分以上)を導出し、形式的な保証を提供。

実験結果

リサーチクエスチョン

  • RQ1低レベルの並列プログラミングの複雑さを回避しつつ、開発者にとって実用的で合成可能な損失ありグラフ圧縮をどのように実現できるか?
  • RQ2視覚的類似性を超えた、効果的で測定可能な損失あり圧縮の正確性評価基準は何か?
  • RQ3損失あり圧縮は、連結成分、最短経路、スペクトル的特性といった重要なグラフ特性を保持できるか?
  • RQ4損失あり圧縮によって、グラフサイズをどの程度削減し、グラフアルゴリズムの実行をどの程度高速化できるか、結果の忠実度を損なわずに行えるか?
  • RQ5多様なグラフワークロードにわたる、新しい損失あり圧縮方式の開発、評価、拡張を支援する統合フレームワークはどのように構築できるか?

主な発見

  • Slim Graph は、連結成分や最小スパニングツリーといった重要なグラフ特性を保持しつつ、最大で80%のストレージ削減を実現。
  • PageRank や SSSP といったグラフアルゴリズムにおいて、圧縮グラフ上で最大3.5倍の高速化を達成し、結果の正確性の損失は最小限に抑えられた。
  • Slim Graph に組み込まれた新しい圧縮手法「三角形削減(TR)」は、圧縮後の最大基数マッチング(MCM)サイズが元のMCMの半分以上であることを保証する。
  • Kullback-Leibler 散乱などの統計的乖離は、確率的特性における情報損失を効果的に定量化でき、正確な正確性評価を可能にした。
  • Slim Graph は、Sogou ウェブグラフなど、公開済みの最大規模のグラフの分散損失あり圧縮をサポートし、スケーラビリティと実世界応用の可能性を示した。
  • 理論的分析により、さまざまな圧縮方式にわたる50以上の特性保持に関する境界が導出され、アルゴリズムの忠実度を保証する形式的根拠が得られた。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。