Skip to main content
QUICK REVIEW

[論文レビュー] Tight and simple Web graph compression

Szymon Grabowski, Wojciech Bieniecki|arXiv (Cornell University)|Jun 4, 2010
Algorithms and Data Compression参考文献 19被引用数 7
ひとこと要約

本稿では、ハイパーリンクリスト内の構造的冗長性を活用することで、優れた圧縮比を達成する2つの新しいWebグラフ圧縮アルゴリズムを提案する。1つ目の手法は可変ブロックサイズと強化された微分符号化を用い、空間の削減を図るが、アクセス速度が遅くなる。2つ目の手法は隣接するリストを順序付き構造に統合し、圧縮率とアクセス時間のトレードオフを競争的に実現する。1エッジあたり1.06ビットの圧縮率を達成し、先行研究を上回りながらも実用的なアクセス速度を維持している。

ABSTRACT

Analysing Web graphs has applications in determining page ranks, fighting Web spam, detecting communities and mirror sites, and more. This study is however hampered by the necessity of storing a major part of huge graphs in the external memory, which prevents efficient random access to edge (hyperlink) lists. A number of algorithms involving compression techniques have thus been presented, to represent Web graphs succinctly but also providing random access. Those techniques are usually based on differential encodings of the adjacency lists, finding repeating nodes or node regions in the successive lists, more general grammar-based transformations or 2-dimensional representations of the binary matrix of the graph. In this paper we present two Web graph compression algorithms. The first can be seen as engineering of the Boldi and Vigna (2004) method. We extend the notion of similarity between link lists, and use a more compact encoding of residuals. The algorithm works on blocks of varying size (in the number of input lines) and sacrifices access time for better compression ratio, achieving more succinct graph representation than other algorithms reported in the literature. The second algorithm works on blocks of the same size, in the number of input lines, and its key mechanism is merging the block into a single ordered list. This method achieves much more attractive space-time tradeoffs.

研究の動機と目的

  • Webグラフのサイズが利用可能なRAMを上回るため、主記憶装置に大規模なWebグラフを格納する課題に対処すること。
  • 既存の手法を上回る圧縮比を実現しながら、隣接リストへの効率的なランダムアクセスを維持すること。
  • 要約的Webグラフ表現における空間効率とアクセスパフォーマンスのトレードオフを調査すること。
  • ハイパーリンクリスト内の局所的およびグローバルな冗長性を活用して、より優れた圧縮を実現する手法を開発すること。
  • 提案手法の性能を実世界のWebグラフデータセットを用いて評価すること。

提案手法

  • 1番目のアルゴリズムは可変サイズのブロックを用いた隣接リストと、BoldiとVignaの類似性に基づく圧縮を拡張し、残差符号化を改善し、ブロックに対してDeflate圧縮を適用する。
  • 各ブロック内のリストに対して微分符号化を適用し、各リストが直前のリストを参照し、差分(残差)のみを格納する。
  • 2番目のアルゴリズムは固定サイズのブロックを処理し、ブロック内のすべてのリストを1つの順序付きリストに統合することで、グローバルな冗長性検出によるより効果的な圧縮を実現する。
  • ハイブリッドアプローチを採用:LM-bitmapは高速アクセスを、LM-diffは高圧縮を実現する。両者ともブロック単位の統合と微分符号化を活用する。
  • 残差に対してDeflate圧縮を適用し、4つの実世界のWebグラフデータセットを直接および転置形式でテストする。
  • システムはJavaで実装され、1 GB RAMを搭載した3.0 GHz Pentium4マシンで評価され、1エッジあたりのビット数(bpe)と1エッジあたりのアクセス時間(μs)を測定した。

実験結果

リサーチクエスチョン

  • RQ1ハイパーリンクリスト間の類似性の概念を、元のBoldi–Vigna手法を越えて拡張することで、Webグラフ圧縮を改善できるか?
  • RQ2ブロック内の複数の隣接リストを1つの順序付きリストに統合することで、個々のリストに対する微分符号化よりも優れた圧縮が達成できるか?
  • RQ3Webグラフ圧縮において、圧縮比とアクセス時間のバランスを最適化するための最適なブロックサイズは何か?
  • RQ4提案手法は、Boldi–Vigna や文法ベースの手法といった従来の手法と比較して、空間時間トレードオフにおいてどのように差をつけるか?
  • RQ5提案手法は1.1 bpe未満の圧縮を達成しつつ、SSDディスクアクセスと競争可能なアクセス時間を維持できるか?

主な発見

  • LM-diffバージョンは、16384バイトのブロックサイズでIndochina-2004データセットに対して1.061 bpeの圧縮比を達成し、先行研究を上回った。
  • EU-2005データセットでは、LM-bitmapバージョンがh=32で1.485 bpeを達成し、優れた圧縮性能と妥当なアクセス時間の両方を実現した。
  • ブロックサイズが大きくなるとアクセス時間が増加した:Indochina-2004では16384バイトブロックで1エッジあたり57.39 μs、1024バイトブロックでは6.50 μsであった。
  • ブロックサイズを1024から16384バイトに倍増させたことで、平均して約10%のストレージ削減が達成されたが、アクセス時間は平均で約9倍に増加した。
  • Indochina-2004でh=64のとき、LM-diffはLM-bitmapに比べ74%の遅延を示したが、平均的な遅延はそれほど顕著ではなかった。
  • 提案手法は、標準の7200 RPMハードディスク(約10 ms)よりもはるかに高速なアクセス時間を達成しており、BV や Claude–Navarro 手法よりも1〜2桁遅いものの、実用的である。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。