Skip to main content
QUICK REVIEW

[論文レビュー] CommunityGAN: Community Detection with Generative Adversarial Nets

Yuting Jia, Qinqin Zhang|arXiv (Cornell University)|Jan 20, 2019
Complex Network Analysis Techniques参考文献 37被引用数 6
ひとこと要約

CommunityGANは、学習された埋め込み空間内で頂点-コミュニティ所属強度を直接モデル化することにより、重複するコミュニティ検出とグラフ表現学習を統合的に実行する、GANベースの新規フレームワークを提案する。モチーフレベルの生成的対抗ネットワークを用いることで、コミュニティ構造の発見を向上させ、合成ネットワークおよび実世界のネットワークの両方で最先端の性能を達成した。特に、密な重複コミュニティの検出と局所的なクリーク構造の保持において優れた性能を示した。

ABSTRACT

Community detection refers to the task of discovering groups of vertices sharing similar properties or functions so as to understand the network data. With the recent development of deep learning, graph representation learning techniques are also utilized for community detection. However, the communities can only be inferred by applying clustering algorithms based on learned vertex embeddings. These general cluster algorithms like K-means and Gaussian Mixture Model cannot output much overlapped communities, which have been proved to be very common in many real-world networks. In this paper, we propose CommunityGAN, a novel community detection framework that jointly solves overlapping community detection and graph representation learning. First, unlike the embedding of conventional graph representation learning algorithms where the vector entry values have no specific meanings, the embedding of CommunityGAN indicates the membership strength of vertices to communities. Second, a specifically designed Generative Adversarial Net (GAN) is adopted to optimize such embedding. Through the minimax competition between the motif-level generator and discriminator, both of them can alternatively and iteratively boost their performance and finally output a better community structure. Extensive experiments on synthetic data and real-world tasks demonstrate that CommunityGAN achieves substantial community detection performance gains over the state-of-the-art methods.

研究の動機と目的

  • 従来のグラフ表現学習手法の限界に対処する。具体的には、埋め込み値が意味的意味を持たず、重複するコミュニティ所属を直接表現できないこと。
  • K-means や GMM などの標準的なクラスタリング手法が、実世界のネットワークに一般的に見られる密な重複コミュニティを検出できないという問題を克服する。
  • モチーフレベルの構造に特化した生成的対抗ネットワークを用いて、コミュニティ検出と表現学習を統合的に最適化するフレームワークを構築する。
  • 局所的なネットワークモチーフ(特にクリーク)のモデリングを向上させるために、生成プロセスに構造的認識を組み込むことで、より良いコミュニティ検出を実現する。
  • 埋め込みをコミュニティへの所属強度として直接解釈可能にすることで、より正確で意味のあるコミュニティ推論を可能にする。

提案手法

  • 頂点埋め込みベクトルが複数のコミュニティへの所属強度を符号化するグラフ表現学習フレームワークを設計。これはアフィリエーショングラフモデル(AGM)をインspirationとしている。
  • 特定のモチーフタイプ(例:3クリーク、4クリーク)を頂点 $v_c$ を中心として形成する可能性の高い頂点部分集合 $s$ を生成する、生成器 $G(s|v_c)$ を備えたモチーフレベルの生成的対抗ネットワーク(GAN)を導入する。
  • 実際のモチーフ(真のネットワークからのもの)と生成器が生成する偽のモチーフを区別するための識別器 $D(s)$ を実装し、両モデルを反復的に改善するミニマックスゲームを形成する。
  • 構造的認識を備えた高尤度のモチーフを計算効率よく生成するための新規手法「Graph AGM」を採用し、学習中の計算効率を確保する。
  • GANをエンドツーエンドで訓練することで、生成器が敵対的フィードバックを通じてコミュニティ構造を学習し、埋め込み空間が直接的にコミュニティ所属確率を反映するようにする。
  • 下流タスク(例:クリーク予測)のためのロジスティック回帰を学習済み埋め込みに適用し、学習済み表現の質を検証する。

実験結果

リサーチクエスチョン

  • RQ1GANベースのフレームワークは、従来の手法よりも、重複コミュニティ検出とグラフ表現学習を統合的に最適化できるか?
  • RQ2頂点埋め込みを直接的なコミュニティ所属強度としてモデル化することで、従来のクラスタリングベースのアプローチと比較して、密な重複コミュニティの検出がどの程度向上するか?
  • RQ3モチーフレベルでの生成と識別が、クリークなどの局所的ネットワーク構造を捉えるための学習済み表現の質をどの程度向上させるか?
  • RQ4提案されたCommunityGANフレームワークは、合成データおよび実世界のデータの両方において、最先端の手法を上回る性能を示すか?
  • RQ5学習済み埋め込みは、3クリークおよび4クリークのパターンといった構造的情報を、クリーク予測性能で測定した際に、効果的に保持できるか?

主な発見

  • 合成データでは、CommunityGANは4クリーク検出でF1スコア0.970を達成し、AGM(0.959)、LINE(0.963)、GraphGAN(0.855)を上回り、複雑な局所的構造の検出において優れた性能を示した。
  • arXiv-GrQcでは、3クリーク予測でAUC 0.993を達成し、次に優れたベースライン(ComE、0.924)と比較して相対的に74.52%の向上を示し、優れた局所構造符号化能力を示した。
  • arXiv-GrQcにおける4クリーク予測でも、CommunityGANはAUC 0.956を達成し、ComE(0.914)とGraphGAN(0.728)を上回り、ComEと比較して絶対的に4.60%の向上を示した。
  • 速度は最速のモデルではないが、訓練時間は妥当な範囲に保たれ、特に複雑な構造の検出において、node2vec や LINE といった高速なベースラインを著しく上回った。
  • CommunityGANは、5つの実世界データセットにおいて、重複コミュニティ検出の全ベースラインを一貫して上回り、3クリークおよび4クリーク予測のF1スコアにおいて顕著な向上を示した。
  • 埋め込み設計が直接的に所属強度を符号化しているため、従来のグラフ埋め込み手法とは異なり、外部のクラスタリングアルゴリズムに依存せずに、直接的かつ解釈可能なコミュニティ検出が可能になった。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。