Skip to main content
QUICK REVIEW

[論文レビュー] A Novel Approach to Finding Near-Cliques: The Triangle-Densest Subgraph Problem

Charalampos E. Tsourakakis|arXiv (Cornell University)|May 7, 2014
Complexity and Algorithms in Graphs参考文献 78被引用数 18
ひとこと要約

本稿では、平均三角形密度を最大化することで、大規模グラフにおける準クリークを近似的に特定する多項式時間の新しいアプローチ、三角形密度が最大の部分グラフ(TDS)問題を導入する。標準の密集部分グラフ(DS)問題とは異なり、高次数だがクリーク密度が低い部分グラフを好むのではなく、TDSは正確なアルゴリズムおよび近似アルゴリズムを用いて、DS問題が失敗する場合でも特に準クリークを効果的に同定する。これには1/3近似アルゴリズムとMapReduce対応実装が含まれる。

ABSTRACT

Many graph mining applications rely on detecting subgraphs which are near-cliques. There exists a dichotomy between the results in the existing work related to this problem: on the one hand the densest subgraph problem (DSP) which maximizes the average degree over all subgraphs is solvable in polynomial time but for many networks fails to find subgraphs which are near-cliques. On the other hand, formulations that are geared towards finding near-cliques are NP-hard and frequently inapproximable due to connections with the Maximum Clique problem. In this work, we propose a formulation which combines the best of both worlds: it is solvable in polynomial time and finds near-cliques when the DSP fails. Surprisingly, our formulation is a simple variation of the DSP. Specifically, we define the triangle densest subgraph problem (TDSP): given $G(V,E)$, find a subset of vertices $S^*$ such that $τ(S^*)=\max_{S \subseteq V} \frac{t(S)}{|S|}$, where $t(S)$ is the number of triangles induced by the set $S$. We provide various exact and approximation algorithms which the solve the TDSP efficiently. Furthermore, we show how our algorithms adapt to the more general problem of maximizing the $k$-clique average density. Finally, we provide empirical evidence that the TDSP should be used whenever the output of the DSP fails to output a near-clique.

研究の動機と目的

  • 密集部分グラフ(DS)問題が多項式時間で解けるものの、準クリークを検出できないという限界を解消すること。
  • クリークに基づく定式化の非効用性を克服し、三角形密度に基づく新たな扱いやすい目的関数を導入すること。
  • 現実世界のネットワークにおける準クリーク構造をDSよりも優れた性能で同定できる効率的アルゴリズムを開発すること。
  • 定数kに対して平均kクリーク密度を最大化するようにアプローチを一般化し、高次元の密集部分グラフへの応用可能性を拡張すること。
  • ユーザー定義のクエリ集合を組み込んだTDS問題の制約付きバージョンを提供し、特定の部分グラフ探索に有用なようにすること。

提案手法

  • 部分グラフSにおける誘導三角形数t(S)と頂点数|S|の比を最大化する三角形密度が最大の部分グラフ(TDS)問題を定義する:$ \tau(S) = \frac{t(S)}{|S|} $。
  • 3つの正確なアルゴリズムを提案し、最も効率的なものは最大フロー計算に基づくもので、既存のDSソルバーから一般化できない、TDS問題に特化した設計である。
  • 三角形寄与度に基づく貪欲な頂点追加戦略を用いる、$ \frac{1}{3} $近似アルゴリズムを導入し、正確な手法よりも高速に実行可能である。
  • 効率的な三角形数え上げプリミティブを活用し、$ O(\log n / \epsilon) $ラウンドで実行可能な、MapReduce互換の$ \frac{1}{3+3\epsilon} $近似アルゴリズムを設計する。
  • 定数kに対して平均kクリーク密度を最大化する枠組みを一般化し、三角形を超えた拡張を可能にする。
  • クエリ集合$ Q $が固定されたTDSの制約付きバージョンを統合し、三角形密度を最大化する頂点を追加することで、$ Q $の周囲に密集部分グラフを構築する。

実験結果

リサーチクエスチョン

  • RQ1DS問題が失敗する状況でも、信頼性高く準クリークを検出できる多項式時間の目的関数を設計できるか?
  • RQ2コミュニティ構造を示す現実世界のネットワークにおいて、三角形密度が最大の部分グラフ定式化は、標準的な密集部分グラフと比べてどのように性能を発揮するか?
  • RQ3TDS問題のアルゴリズムの近似精度とスケーラビリティ、特にMapReduceのような分散環境における性能はいかがなものか?
  • RQ4TDS定式化を、$ K_4 $などの高次元クリークに基づく密集部分グラフ検出に一般化できるか、かつ計算の扱いやすさを維持できるか?
  • RQ5特定のクエリノード(例えば政治家や研究者)を中心にした凝集的部分グラフを同定する際、制約付きTDSバージョンはどの程度有効か?

主な発見

  • DS問題が失敗する状況、例えば三角形と大きな完全二部グラフクリークから構成されるグラフにおいて、TDS問題は三角形を正しく選択し、準クリークを効果的に同定する。
  • 米国上院の投票行動ネットワーク(100人の上院議員)において、$ \frac{1}{3} $近似アルゴリズムは、100%共和党政権の47頂点の部分グラフを回復し、主要政党のクラスタを捉えている。
  • DBLP共同著者ネットワークにおいて、アルゴリズムはイタリアのコンピュータ科学者44名の密集した三角形豊富なグループを回復しており、出力部分グラフはクエリ集合から分離している。
  • TDS問題は、DBLPにおける上位7つの三角形密度が最大の部分グラフが、上位7つのDS出力よりも高いクリーク的構造を持つことから、凝集的・クリークに類似したコミュニティを検出する点でDS問題を常に上回っている。
  • 予備的結果では、kを3から4(つまり$ K_4 $密度)に増加させることで利益が得られるが、DSからTDSへの改善ははるかに顕著であり、TDSの独自の価値が示唆されている。
  • MapReduce実装は、$ O(\log n / \epsilon) $ラウンドで$ \frac{1}{3+3\epsilon} $近似を達成し、効率的な三角形数え上げを活用することで、大規模グラフへのスケーラビリティを示している。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。