Skip to main content
QUICK REVIEW

[論文レビュー] Dink-Net: Neural Clustering on Large Graphs

Yue Liu, Ke Liang|arXiv (Cornell University)|May 28, 2023
Advanced Graph Neural Networks被引用数 6
ひとこと要約

Dink-Net は、敵対的拡張および収縮損失関数を用いて表現学習とクラスタリング最適化をエンド・ツー・エンドのフレームワークに統合するスケーラブルなディープグラフクラスタリング手法である。ogbn-papers100M(111Mノード、1.6Bエッジ)において、ランナーアップより9.62%高いNMIを達成しており、フルグラフ拡散行列やグローバルクラスタリング分布の処理に起因するメモリ不足や長時間の学習時間の問題を解消し、パフォーマンスに劣化を来さずにミニバッチ最適化により優れたスケーラビリティと効率性を実現している。

ABSTRACT

Deep graph clustering, which aims to group the nodes of a graph into disjoint clusters with deep neural networks, has achieved promising progress in recent years. However, the existing methods fail to scale to the large graph with million nodes. To solve this problem, a scalable deep graph clustering method (Dink-Net) is proposed with the idea of dilation and shrink. Firstly, by discriminating nodes, whether being corrupted by augmentations, representations are learned in a self-supervised manner. Meanwhile, the cluster centres are initialized as learnable neural parameters. Subsequently, the clustering distribution is optimized by minimizing the proposed cluster dilation loss and cluster shrink loss in an adversarial manner. By these settings, we unify the two-step clustering, i.e., representation learning and clustering optimization, into an end-to-end framework, guiding the network to learn clustering-friendly features. Besides, Dink-Net scales well to large graphs since the designed loss functions adopt the mini-batch data to optimize the clustering distribution even without performance drops. Both experimental results and theoretical analyses demonstrate the superiority of our method. Compared to the runner-up, Dink-Net achieves 9.62% NMI improvement on the ogbn-papers100M dataset with 111 million nodes and 1.6 billion edges. The source code is released at https://github.com/yueliu1999/Dink-Net. Besides, a collection (papers, codes, and datasets) of deep graph clustering is shared at https://github.com/yueliu1999/Awesome-Deep-Graph-Clustering.

研究の動機と目的

  • 100万ノードを超える大規模グラフにおける、従来のディープグラフクラスタリング手法のスケーラビリティの制限を克服する。
  • フルグラフ拡散行列やグローバルクラスタリング分布の処理に起因するメモリ不足および長時間の学習時間を解消する。
  • 表現学習とクラスタリング最適化をエンド・ツー・エンドのフレームワークに統合し、クラスタリングに適した特徴を学習する。
  • パフォーマンスの低下を来さずに、ミニバッチデータを用いた効率的な大規模グラフの学習を可能にする。
  • 低メモリおよび低時間コストを維持しながら、大規模グラフクラスタリングベンチマークで最先端のパフォーマンスを達成する。

提案手法

  • 自己教師付きの方法で、元のノードと拡張されたバージョンを区別することで表現を学ぶノード識別モジュールを提案する。
  • 学習可能なクラスタ中心をニューラルパラメータとして導入し、学習中に最適化する。
  • 2つの新しい損失関数を設計する:クラスタ拡張損失(異なるクラスタを引き離すために)とクラスタ収縮損失(サンプルをそのクラスタ中心に引き寄せるために)、これらは敵対的に最適化される。
  • ミニバッチデータを用いて識別損失およびクラスタリング損失を計算し、大規模グラフへのスケーラビリティを実現する。
  • 表現学習とクラスタリング最適化を1つのエンド・ツー・エンドの学習パイプラインに統合する。
  • 2段階の学習プロセスを採用する:ノード識別による事前学習の後、クラスタリング損失を用いたファインチューニング。

実験結果

リサーチクエスチョン

  • RQ11億ノードを超えるグラフに対して、パフォーマンスの劣化を来さずにディープグラフクラスタリングを効果的にスケーリングできるか?
  • RQ2拡張および収縮損失による敵対的最適化によって、大規模グラフにおけるクラスタリング性能が向上するか?
  • RQ3表現学習とクラスタリングのエンド・ツー・エンドの共同最適化は、分離されたアプローチよりも、よりクラスタリングに適した特徴を生成するか?
  • RQ4ミニバッチベースのクラスタリング損失計算は、大規模グラフにおけるパフォーマンスを維持しながら、メモリ不足を回避できるか?
  • RQ5大規模グラフデータセットにおいて、Dink-Net は最先端のベースラインと比較して、スケーラビリティ、効率性、クラスタリングパフォーマンスの面で優れているか?

主な発見

  • Dink-Net は、11100万ノードおよび16億エッジを有する ogbn-papers100M データセットにおいて、ランナーアップの手法よりも9.62%高い正規化相互情報量(NMI)を達成した。
  • Dink-Net は、ogbn-papers100M において、他の手法がCPUで約5日間を要するのに対し、学習時間を約12時間(9時間の事前学習、3時間のファインチューニング)に短縮した。
  • Dink-Net は、ogbn-papers100M でわずか約20GBのGPUメモリしか使用せず、40GBのGPUでもベースライン手法が発生させるメモリ不足の問題を回避した。
  • 7つのベンチマークデータセットにわたり、高いパフォーマンスを維持し、強力なスケーラビリティとロバストネスを示した。
  • 理論的および実験的分析により、ミニバッチ設定下で拡張および収縮損失がクラスタリング分布を効果的に最適化することが確認された。
  • エンド・ツー・エンドのフレームワークは、表現学習とクラスタリング最適化を分離する手法(例:S3GC)よりも優れたクラスタリングパフォーマンスをもたらした。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。