Skip to main content
QUICK REVIEW

[論文レビュー] FedGL: Federated Graph Learning Framework with Global Self-Supervision

Chuan Chen, Weibo Hu|arXiv (Cornell University)|May 7, 2021
Privacy-Preserving Technologies in Data参考文献 61被引用数 11
ひとこと要約

FedGL は、データの機微性を保ちながら、クライアント間でグローバルな偽ラベルと偽グラフを共有することで、グローバルな自己教師あり学習を実現するフェデレーテッドグラフ学習フレームワークである。4つのベンチマークデータセットにおけるノード分類タスクにおいて、データの非同一性を緩和し、補完的なグラフ情報を活用することで、ベースラインを著しく上回る性能を発揮する。

ABSTRACT

Graph data are ubiquitous in the real world. Graph learning (GL) tries to mine and analyze graph data so that valuable information can be discovered. Existing GL methods are designed for centralized scenarios. However, in practical scenarios, graph data are usually distributed in different organizations, i.e., the curse of isolated data islands. To address this problem, we incorporate federated learning into GL and propose a general Federated Graph Learning framework FedGL, which is capable of obtaining a high-quality global graph model while protecting data privacy by discovering the global self-supervision information during the federated training. Concretely, we propose to upload the prediction results and node embeddings to the server for discovering the global pseudo label and global pseudo graph, which are distributed to each client to enrich the training labels and complement the graph structure respectively, thereby improving the quality of each local model. Moreover, the global self-supervision enables the information of each client to flow and share in a privacy-preserving manner, thus alleviating the heterogeneity and utilizing the complementarity of graph data among different clients. Finally, experimental results show that FedGL significantly outperforms baselines on four widely used graph datasets.

研究の動機と目的

  • プライバシーおよび規制上の制約により、グラフデータが複数のクライアントに分散している状況において、高品質なグラフモデルを訓練する課題に対処すること。
  • クライアントが異なるノード、エッジ、ラベル、グラフ構造を持つフェデレーテッドグラフ学習における統計的および構造的非同一性を克服すること。
  • クライアント間で重複するノードを活用し、生のデータを共有せずにグラフデータの補完的情報を活用すること。
  • データの集約を必要とせず、多様なグラフモデルおよびフェデレーテッド設定に一般化可能なフレームワークを構築すること。
  • 生のグラフデータの代わりに、モデルの出力(予測値と埋め込み)のみを共有することで、プライバシーの保護を確保すること。

提案手法

  • クライアントは自らのプライベートデータを用いて局所的なグラフニューラルネットワークを訓練し、中央サーバーに予測値とノード埋め込みのみをアップロードする。
  • サーバーはクライアント間の予測を集約し、信頼度の閾値を用いて高精度な予測をフィルタリングすることで、グローバルな偽ラベルを計算する。
  • サーバーは、信頼度が高く、類似した予測を持つノードを特定・接続することで、グローバルな偽グラフを構築する。
  • 得られたグローバルな偽ラベルとグローバルな偽グラフをクライアントに再配布し、局所的な学習ラベルを強化し、局所的なグラフ構造を拡張する。
  • 自己教師あり学習損失を導入し、主タスクの損失に加えてグローバルな偽ラベルとグローバルな偽グラフを組み合わせることで、一般化性能を向上させる。
  • ハイパーパrameter α(自己教師あり学習の強度)と β(偽グラフの重要度)を用いて、グローバルな自己教師あり学習と主タスク学習の寄与度をバランスさせる。

実験結果

リサーチクエスチョン

  • RQ1データの非同一性とプライバシー制約が存在する中で、グローバルな自己教師あり学習がフェデレーテッドグラフ学習の性能を向上させ得るか?
  • RQ2クライアントの予測から導出されるグローバルな偽ラベルは、局所的およびグローバルなモデル精度を向上させるためにどの程度有効か?
  • RQ3局所的なグラフ構造にグローバルな偽グラフを補完することで、モデルの一般化性能はどの程度向上するか?
  • RQ4信頼度閾値 λ、自己教師あり学習係数 α、近隣ノード数 s といったハイパーパrameter は、FedGL のロバストネスと性能にどのように影響するか?
  • RQ5重複するが同一でないグラフデータを持つさまざまなグラフモデルおよび実世界のシナリオにおいて、FedGL は一般化可能か?

主な発見

  • Citeseer データセットにおいて、FedGL はグローバルな偽ラベルを用いることで、ベースラインのフェデレーテッド手法に比べてノード分類精度を少なくとも 5% 向上させた。
  • グローバルな偽ラベル生成に最適な信頼度閾値 λ は [0.1, 0.3] の範囲にあり、この区間で性能が安定している。
  • 自己教師あり学習係数 α は 0.3 未満に設定した場合に最も良好な性能を示し、それ以上の値では自己教師あり信号の過剰強調により性能が低下した。
  • グローバルな偽グラフ係数 β は [0, 1] の範囲で安定した性能を示し、精度に顕著な低下がなかったため、偽グラフ統合の強度に頑健であることが示された。
  • グローバルな偽グラフの近隣ノード数 s は性能にほとんど影響を与えず、s = 5 から s = 1000 の範囲で安定した結果を示し、スケーラビリティとロバストネスを示した。
  • FedGL は、Cora、Citeseer、ACM、Wiki の4つのすべてのデータセットにおいて、中央集権的および単純なフェデレーテッドベースラインを一貫して上回り、実世界のフェデレーテッドグラフ学習における有効性を確認した。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。