Skip to main content
QUICK REVIEW

[論文レビュー] Efficient Bitruss Decomposition for Large-scale Bipartite Graphs

Kai Wang, Xuemin Lin|arXiv (Cornell University)|Jan 16, 2020
Data Mining Algorithms and Applications参考文献 25被引用数 4
ひとこと要約

本稿では、BE-Indexと呼ばれる新規オンラインインデックスを導入することで、大規模な二部グラフにおけるビトラス分解のための効率的アルゴリズム、BiT-BUおよびBiT-PCを提案する。BE-Indexはバタフライをk-ブloom(すなわち(2,k)-バイクリーク)に圧縮する。このアプローチにより、時間計算量が低減され、実世界のデータセット上での分解が最大2桁の速度向上を達成し、先行研究を著しく上回る性能を発揮する。

ABSTRACT

Cohesive subgraph mining in bipartite graphs becomes a popular research topic recently. An important structure k-bitruss is the maximal cohesive subgraph where each edge is contained in at least k butterflies (i.e., (2, 2)-bicliques). In this paper, we study the bitruss decomposition problem which aims to find all the k-bitrusses for k >= 0. The existing bottom-up techniques need to iteratively peel the edges with the lowest butterfly support. In this peeling process, these techniques are time-consuming to enumerate all the supporting butterflies for each edge. To relax this issue, we first propose a novel online index -- the BE-Index which compresses butterflies into k-blooms (i.e., (2, k)-bicliques). Based on the BE-Index, the new bitruss decomposition algorithm BiT-BU is proposed, along with two batch-based optimizations, to accomplish the butterfly enumeration of the peeling process in an efficient way. Furthermore, the BiT-PC algorithm is devised which is more efficient against handling the edges with high butterfly supports. We theoretically show that our new algorithms significantly reduce the time complexities of the existing algorithms. Also, we conduct extensive experiments on real datasets and the result demonstrates that our new techniques can speed up the state-of-the-art techniques by up to two orders of magnitude.

研究の動機と目的

  • エッジピーリング中に高コストなバタフライ列挙が引き起こす、従来のボトムアップビトラス分解アルゴリズムの性能ボトルネックを解消する。
  • 社会的ネットワーク、レコメンデーションシステム、学術的ネットワークに一般的に見られる大規模な二部グラフのスケーラブルな解析を可能にするために、計算オーバーヘッドを低減する。
  • 動的エッジ処理に適した、バタフライサポートを効率的に管理・圧縮する新規オンラインインデックス構造、BE-Indexの開発。
  • 重複するバタフライサポートの更新を最小限に抑えることで、ハイドゥーバー(ハブ)エッジ上で高い性能を発揮する最適化アルゴリズム、BiT-BUおよびBiT-PCの設計。
  • 正しくかつスケーラブルに動作する一方で、既存の最先端技術を著しく上回る高速化を実現する。

提案手法

  • バタフライをすべてk-ブーム(すなわち(2,k)-バイクリーク)に圧縮するオンラインインデックス、BE-Indexを導入し、バタフライサポートの追跡を効率的に行う。
  • エッジピーリング中に繰り返しバタフライを列挙する必要がなくなるBE-Indexを活用するボトムアップ分解法、BiT-BUを設計。
  • バッチエッジ処理とバッチブーム処理の2つのバッチベース最適化を統合し、更新回数を削減し、キャッシュ効率を向上。
  • 高サポートエッジを最初に処理するプログレッシブ圧縮ベースのアルゴリズム、BiT-PCを提案。繰り返しグラフを圧縮することで、以降のバタフライサポートの更新を低減。
  • BiT-PCにおけるパラメータτを用いて、グラフ圧縮のレートを制御し、イテレーション回数と更新オーバーヘッドのバランスを最適化。
  • 理論的分析により、BiT-BUおよびBiT-PCは、重複するバタフライカウントと更新操作を削減することで、先行手法よりも低い時間計算量を達成することが示された。

実験結果

リサーチクエスチョン

  • RQ1エッジピーリング中に繰り返しバタフライ列挙が発生する問題を最小限に抑えることで、大規模二部グラフにおけるビトラス分解の時間計算量をどのように低減できるか?
  • RQ2効率的にバタフライサポートを捉え、圧縮するオンラインインデックス構造を設計できるか?
  • RQ3ボトムアップ分解パイプラインに適用可能な最適化は何か? これにより、更新オーバーヘッドを低減し、大規模グラフ上で性能を向上できるか?
  • RQ4BiT-PCにおけるプログレッシブなグラフ圧縮は、通常のピーリングと比較して、高いバタフライサポートを持つエッジ上でどのように性能を向上させるか?
  • RQ5多様な実世界データセットにおいて、イテレーション回数と更新コストのバランスを最適化するための、BiT-PCにおける圧縮パラメータτの最適な設定は何か?

主な発見

  • 提案されたBiT-BUおよびBiT-PCアルゴリズムは、Wiki-itやD-styleなどの実世界データセット上で、最先端手法比最大2桁の高速化を達成した。
  • 6億以上のバタフライを含むWiki-itデータセットにおいて、BE-Indexデータ構造はメインメモリを4GB未満で使用しており、優れた空間効率性を示した。
  • BiT-BU++におけるバッチベース最適化により、計算コストとサポート更新回数の両方が低減され、特にバッチブーム処理が最も顕著な性能向上をもたらした。
  • D-styleやWiki-itなどの大規模データセットでは、BiT-PCがBiT-BUおよびBiT-BU++を上回り、ハブエッジをより一貫性のある部分グラフ内で処理することで、以降の更新を90%以上削減した。
  • BiT-PCにおけるパラメータτは、0.05から0.2の範囲で設定された場合、性能にほとんど影響を及ぼさないことが判明し、多様なグラフ構造にわたり、ロバストでチューニングが容易であることが示された。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。