[論文レビュー] Self-supervised Contrastive Attributed Graph Clustering
本稿では、不正確なクラスタリングラベルを用いた対照的損失を用いて、ノード表現学習とクラスタリングを共同最適化する自己教師付き対照的属性付きグラフクラスタリング手法 SCAGC を提案する。エンドツーエンドのフレームワークにおいて、自己教師付きグラフ対照的学習モジュールとクラスタリングモジュールを統合することで、4つのベンチマークデータセットにおいて最先端の性能を達成し、NMI で最大 7.7% の向上を達成するとともに、Out-of-sample ノードのラベルを直接予測可能となる。
Attributed graph clustering, which learns node representation from node attribute and topological graph for clustering, is a fundamental but challenging task for graph analysis. Recently, methods based on graph contrastive learning (GCL) have obtained impressive clustering performance on this task. Yet, we observe that existing GCL-based methods 1) fail to benefit from imprecise clustering labels; 2) require a post-processing operation to get clustering labels; 3) cannot solve out-of-sample (OOS) problem. To address these issues, we propose a novel attributed graph clustering network, namely Self-supervised Contrastive Attributed Graph Clustering (SCAGC). In SCAGC, by leveraging inaccurate clustering labels, a self-supervised contrastive loss, which aims to maximize the similarities of intra-cluster nodes while minimizing the similarities of inter-cluster nodes, are designed for node representation learning. Meanwhile, a clustering module is built to directly output clustering labels by contrasting the representation of different clusters. Thus, for the OOS nodes, SCAGC can directly calculate their clustering labels. Extensive experimental results on four benchmark datasets have shown that SCAGC consistently outperforms 11 competitive clustering methods.
研究の動機と目的
- 既存のグラフ対照的学習手法が属性付きグラフクラスタリングにおいて抱える限界、すなわち不正確なラベルの不十分な活用、後処理依存性、Out-of-sample ノードの処理不能性を解消すること。
- クラスタリングモジュールからの疑似ラベルを用いて、ノード表現学習とクラスタリング割り当てを共同最適化するエンドツーエンドフレームワークを構築すること。
- 統一された表現とクラスタリング関数を学習することで、新規ノードに対するクラスタリングラベルの直接予測を可能とすること。
- ノード表現における対照的学習とクラスタ割り当てにおける対照的クラスタリング損失の両方を活用することで、クラスタリング性能を向上させること。
- 疑似ラベルの監視が、真のラベルが存在しない状況下でも、グラフ表現学習を向上させ、より判別性が高く、凝縮されたクラスタ構造を実現することを示すこと。
提案手法
- SCAGC は、属性付きグラフの複数のビューを生成するためのグラフオーグメンテーションを採用し、ノード表現およびクラスタ割り当ての両方における対照的学習を可能にする。
- クラスタリングモジュールは、ソフトクラスタ割り当て確率を出力し、これによりクラスタ内での一致を最大化し、クラスタ間での一致を最小化する対照的クラスタリング損失を計算する。
- グラフ表現学習モジュールは、疑似ラベル(クラスタリング割り当て)に基づく自己教師付き対照的損失を用い、同じクラスタに属するノード表現を一致させつつ、異なるクラスタのノード表現を分離する。
- クラスタリングモジュールと表現学習モジュールは、相互に作用し、エンドツーエンドで共同訓練されることで、表現とクラスタ割り当ての相互強化が実現される。
- 新規ノードに対しては、再訓練や後処理を必要とせず、学習済みのクラスタリング関数を直接適用することで Out-of-sample 推論が可能となる。
- 自己教師付き対照的損失は、疑似ラベルクラスタを用いた温度調整付き対照的目的関数に基づき定義され、ノイズの多いラベルでも表現品質の向上が図られる。
実験結果
リサーチクエスチョン
- RQ1不正確なクラスタリングラベルを用いた自己教師付き対照的学習が、属性付きグラフクラスタリングにおけるノード表現品質を向上させ得るか?
- RQ2クラスタリングモジュールとグラフ表現学習モジュールを同時に学習させることで、別々に学習する場合と比較して、より優れたクラスタリング性能が得られるか?
- RQ3提案されたフレームワークは、従来の GCL に基づく手法の主要な限界である Out-of-sample ノードのクラスタリングラベルを直接予測可能か?
- RQ4対照的クラスタリングモジュールは、クラスタ割り当ての精錬と表現の凝縮性向上にどの程度有効か?
- RQ5真のラベルが存在しない状況下で、疑似ラベルの監視が、グラフ対照的学習をどの程度向上させるか?
主な発見
- SCAGC は、4つのベンチマークデータセットにおいて11の最先端手法を常に上回り、DBLP データセットでは NMI で最も近い競合手法 GCA よりも最大 7.7% の向上を達成した。
- アブレーションスタディの結果、対照的クラスタリングモジュールが性能向上に顕著に寄与しており、ACM および DBLP データセットで SCAGC w/o CCM のクラスタリング指標が著しく低下した。
- 疑似ラベルを用いた自己教師付き GCRL 損失が、標準的な対照的損失よりも優れた表現学習を実現しており、SCAGC w/o SSC が完全モデルに劣ることが示された。
- t-SNE 視覚化では、トレーニングの反復回数が増えるにつれてノード表現がより凝縮され、明確に分離されるようになることが確認され、クラスタ構造学習の向上が示された。
- 収束解析から、SCAGC は急速に収束し、最初の 100 イテレーションで目的関数値が著しく低下し、ACM データセットでは 200 イテレーション目でクラスタリング指標が安定した。
- フレームワークは、再訓練や後処理を必要とせず、学習済みのクラスタリング関数を直接適用することで、Out-of-sample ノードを効果的に処理できた。
より良い研究を、今すぐ始めましょう
論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。
クレジットカード登録不要
このレビューはAIが作成し、人間の編集者が確認しました。