[論文レビュー] A Survey of Community Search Over Big Graphs
本調査は、大規模グラフ上のコミュニティサーチ(CS)について包括的なレビューを提供し、kコア、kトランス、kクリークなどの凝集性メトリクスを分析し、多様なグラフタイプにおけるCS手法の評価を行う。効率性、スケーラビリティ、動的更新の面での主な課題を特定し、ビッグデータ、異種、不確実なグラフにおける今後の研究方向性を提案する。
With the rapid development of information technologies, various big graphs are prevalent in many real applications (e.g., social media and knowledge bases). An important component of these graphs is the network community. Essentially, a community is a group of vertices which are densely connected internally. Community retrieval can be used in many real applications, such as event organization, friend recommendation, and so on. Consequently, how to efficiently find high-quality communities from big graphs is an important research topic in the era of big data. Recently a large group of research works, called community search, have been proposed. They aim to provide efficient solutions for searching high-quality communities from large networks in real-time. Nevertheless, these works focus on different types of graphs and formulate communities in different manners, and thus it is desirable to have a comprehensive review of these works. In this survey, we conduct a thorough review of existing community search works. Moreover, we analyze and compare the quality of communities under their models, and the performance of different solutions. Furthermore, we point out new research directions. This survey does not only help researchers to have a better understanding of existing community search solutions, but also provides practitioners a better judgment on choosing the proper solutions.
研究の動機と目的
- 多様なグラフタイプと凝集性メトリクスを対象として、大規模グラフにおけるコミュニティサーチ(CS)手法を体系的かつ比較的にレビューすること。
- リアルタイム性能、100億スケールのグラフへのスケーラビリティ、動的または不確実なグラフ更新のサポートにおける既存CS手法の主な課題を特定すること。
- 特に異種、多次元、符号付きグラフにおけるCSソリューションの欠如という、現在の研究におけるギャップを浮き彫りにすること。
- ベンチマークと実用的導入を加速するために、CSのコードとデータセットのオープンリポジトリの構築を提言すること。
- グラフの特性と応用要件に基づいて、研究者および実務家が適切なCS手法を選定できるようにガイドすること。
提案手法
- kコア、kトランス、kクリーク、k-ECCなどの凝集性メトリクスに基づいてCS手法を分類し、その構造的・計算的特性を分析すること。
- 2010年から2019年までの30件以上の研究を調査し、グラフタイプ(例:静的、不確実、符号付き、多次元、HIN)と凝集性モデルごとに分類すること。
- 接続性、密度、解釈可能性などの指標を用いて、異なるアルゴリズムにおけるコミュニティの性能と品質を評価すること。
- 1000万頂点を超えるグラフにスケーリングするための分散処理およびI/O効率の良い計算モデルを提案すること。
- クエリ頂点および構造的属性に個人化された制約を適用できるオンラインCSのフレームワークを導入すること。
- 再現可能性と実用的採用を可能にするために、標準化されたベンチマークおよび公開されたコード/データセットリポジトリの必要性を強調すること。
実験結果
リサーチクエスチョン
- RQ1kコア、kトランスなどの異なる凝集性メトリクスは、大規模グラフにおけるコミュニティサーチの品質と効率にどのように影響するか?
- RQ2既存のCS手法が、不確実性、動的変化、異種性といった現実世界のグラフ特性を処理する上で直面する主な制限は何か?
- RQ3メインメモリに収まらない100億頂点規模のグラフにCSアルゴリズムをスケーリングするにはどうすればよいか?
- RQ4異種情報ネットワーク(HIN)や多次元グラフといった新興のグラフタイプにおけるコミュニティサーチをサポートする上で、未解決の課題は何か?
- RQ5CSのコードとデータセットのオープンリポジトリは、研究および産業分野における再現性と実用的導入をどのように向上させるか?
主な発見
- 既存の大多数のCS手法は、静的で無向グラフに限定されており、動的更新、不確実な辺、HINのような複雑なグラフタイプをサポートしていない。
- 100億スケールのグラフを処理できる研究は僅かであり(例:Fang:TKDE:CSD、Li:vldb:2015)、多くの手法はメモリおよびI/O制約のため、100万スケールのグラフに限定されている。
- kコアモデルはCSにおける最も広く使われている凝集性メトリクスであり、次いでkトランスとkクリークが続く。それぞれ密度と計算コストの面で異なるトレードオフを持つ。
- 調査された大多数のCS研究において、公開されたコードやデータセットが不足しており、再現性と実用的採用を妨げている。
- 分散処理プラットフォーム(例:GraphX)やI/O効率の良いディスクベースのアルゴリズムは、現実のビッググラフにおけるCSのスケーリングに有望な方向性である。
- これまでの研究では、符号付きグラフ、多次元グラフ、不確実なグラフにおけるコミュニティサーチに対応した研究はなく、顕著な未解決の研究機会が存在する。
より良い研究を、今すぐ始めましょう
論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。
クレジットカード登録不要
このレビューはAIが作成し、人間の編集者が確認しました。