Skip to main content
QUICK REVIEW

[論文レビュー] Federated Graph Machine Learning: A Survey of Concepts, Techniques, and Applications

Xingbo Fu, Binchi Zhang|arXiv (Cornell University)|Jul 24, 2022
Privacy-Preserving Technologies in Data被引用数 13
ひとこと要約

本サーベイは、分散型でプライバシーに配慮したデータソースにまたがるグラフニューラルネットワークの学習を解決策として、フェデレーテッドグラフ機械学習(FGML)を紹介する。FGMLを「構造的データを用いたFL」と「構造的FL」に分類する画期的な分類法を提案し、主要な技術、応用、データセット、プラットフォームをレビューし、データの非独立同分布性(non-IID)、プライバシー漏洩、通信オーバーヘッド、公平性、セキュリティといった未解決の課題を特定し、今後の研究の包括的なロードマップを提示する。

ABSTRACT

Graph machine learning has gained great attention in both academia and industry recently. Most of the graph machine learning models, such as Graph Neural Networks (GNNs), are trained over massive graph data. However, in many real-world scenarios, such as hospitalization prediction in healthcare systems, the graph data is usually stored at multiple data owners and cannot be directly accessed by any other parties due to privacy concerns and regulation restrictions. Federated Graph Machine Learning (FGML) is a promising solution to tackle this challenge by training graph machine learning models in a federated manner. In this survey, we conduct a comprehensive review of the literature in FGML. Specifically, we first provide a new taxonomy to divide the existing problems in FGML into two settings, namely, FL with structured data and structured FL. Then, we review the mainstream techniques in each setting and elaborate on how they address the challenges under FGML. In addition, we summarize the real-world applications of FGML from different domains and introduce open graph datasets and platforms adopted in FGML. Finally, we present several limitations in the existing studies with promising research directions in this field.

研究の動機と目的

  • 複数のクライアントに分散し、プライバシーに配慮したグラフデータ上でグラフ機械学習モデルを学習するという課題に対処すること。
  • クライアント間のグラフ構造の役割に基づいて、『構造的データを用いたFL』と『構造的FL』を区別する、FGMLの新しい分類法を提唱すること。
  • FGMLにおけるクライアント間の欠損情報、構造的プライバシー漏洩、データの非独立同分布性を扱う既存技術を体系的にレビューすること。
  • 医療、金融、バイオインフォマティクス、レコメンデーションシステムなど、実世界のFGML応用を要約すること。
  • 通信効率、公平性、ポisoning攻撃に対する耐性といった分野における、未解決の課題と今後の研究方向性を特定すること。

提案手法

  • 二段階の分類法を提唱:『構造的データを用いたFL』(クライアントは隣接ノードへのアクセスが限定されたローカルサブグラフで学習)と『構造的FL』(クライアント間で情報共有を可能にする高レベルのクライアントグラフを形成)。
  • クライアント境界を越えたメッセージパッシングや表現補完戦略など、クライアント間の欠損情報の緩和に向けた技術をレビュー。
  • 差分プライバシーとノード埋め込みのセキュアアグリゲーションを含む、グラフ構造のプライバシー保護メカニズムを分析。
  • 適応的アグリゲーションやクライアント固有のモデルパーソナライゼーションなど、グラフ構造におけるデータの非独立同分布性への対処法を検討。
  • グラフ固有の依存関係に適合したモデル圧縮やローカル更新スケジューリングなど、通信削減戦略を評価。
  • FederatedScope-GNN や FedGraphNN といったオープンソースプラットフォームを導入・評価し、FGML研究に利用可能なオープングラフデータセットの存在を強調。

実験結果

リサーチクエスチョン

  • RQ1プライバシー制約のもとで、複数のクライアントに分散したグラフデータ上でグラフ機械学習モデルを効果的に学習する方法は何か?
  • RQ2『構造的データを用いたFL』と『構造的FL』の主な違いは何か? また、それらはモデル設計と最適化にどのように影響を与えるか?
  • RQ3ノード特徴量に加え、グラフ構造情報の両方のプライバシーをフェデレーテッド学習中にどのように保護できるか?
  • RQ4非IIDなグラフ構造やクライアント間での欠損した隣接ノード情報によって引き起こされる性能劣化を緩和する技術は何か?
  • RQ5FGMLにおける主な未解決課題は何か? 今後の研究は通信効率、公平性、セキュリティの分野でどのように対処すべきか?

主な発見

  • 本サーベイは、FGMLの主な2つの設定を特定した:『構造的データを用いたFL』と『構造的FL』。両者は、データおよび構造的プライバシーを扱うために、それぞれ異なる技術的対策を要する。
  • クライアント間の欠損情報は依然として主要な課題であり、ノードが他のクライアント上に位置する隣接ノードの特徴にアクセスできないため、表現が不完全になる。
  • 構造的プライバシー漏洩は深刻な懸念事項であり、隣接行列やノード埋め込みは、送信時に機微な関係を特定可能にする可能性がある。
  • FGMLにおける既存の通信戦略は、ノードレベルおよびクライアントレベルの両方のグラフ構造を考慮する必要があるため、標準的なFLに比べて非効率である。
  • FGMLにおける公平性は未だ十分に検討されておらず、クライアント間の構造的差異が、グループ間のモデル性能にバイアスを強める可能性がある。
  • FGMLのベンチマークおよびプラットフォームは限定的であり、現実的で大規模な分散グラフデータを備えていないため、再現性のある実用的でない研究が進みにくい。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。