Skip to main content
QUICK REVIEW

[논문 리뷰] FedGL: Federated Graph Learning Framework with Global Self-Supervision

Chuan Chen, Weibo Hu|arXiv (Cornell University)|2021. 05. 07.
Privacy-Preserving Technologies in Data참고 문헌 61인용 수 11
한 줄 요약

FedGL은 데이터 프라이버시를 유지하면서도 클라이언트 간에 글로벌 가짜 레이블과 가짜 그래프를 공유함으로써 글로벌 자기지도 학습을 통해 모델 성능을 향상시키는 분산 그래프 학습 프레임워크입니다. 데이터 이질성 문제를 완화하고 그래프 정보의 상호보완성을 활용함으로써, 네 가지 기준 데이터셋에서 노드 분류 성능이 기존 기준보다 뚜렷이 향상됩니다.

ABSTRACT

Graph data are ubiquitous in the real world. Graph learning (GL) tries to mine and analyze graph data so that valuable information can be discovered. Existing GL methods are designed for centralized scenarios. However, in practical scenarios, graph data are usually distributed in different organizations, i.e., the curse of isolated data islands. To address this problem, we incorporate federated learning into GL and propose a general Federated Graph Learning framework FedGL, which is capable of obtaining a high-quality global graph model while protecting data privacy by discovering the global self-supervision information during the federated training. Concretely, we propose to upload the prediction results and node embeddings to the server for discovering the global pseudo label and global pseudo graph, which are distributed to each client to enrich the training labels and complement the graph structure respectively, thereby improving the quality of each local model. Moreover, the global self-supervision enables the information of each client to flow and share in a privacy-preserving manner, thus alleviating the heterogeneity and utilizing the complementarity of graph data among different clients. Finally, experimental results show that FedGL significantly outperforms baselines on four widely used graph datasets.

연구 동기 및 목표

  • 개인정보 및 규제 제약으로 인해 그래프 데이터가 여러 클라이언트에 분산되어 있을 경우 고품질의 그래프 모델을 훈련하는 데 도전하는 문제를 해결하기 위해.
  • 클라이언트가 서로 다른 노드, 간선, 레이블 및 그래프 구조를 가진 분산 그래프 학습에서 통계적 및 구조적 이질성을 극복하기 위해.
  • 클라이언트 간에 겹치는 노드를 활용하여 원시 데이터를 공유하지 않고도 그래프 데이터의 상호보완적 정보를 활용하기 위해.
  • 데이터 중앙집중화 없이 다양한 그래프 모델과 분산 환경에서 일반화 가능한 프레임워크를 개발하기 위해.
  • 원시 그래프 데이터 대신 모델 출력물(예측 및 임bedding)만 공유함으로써 프라이버시 보호를 보장하기 위해.

제안 방법

  • 클라이언트는 자신의 비공개 데이터를 사용해 로컬 그래프 신경망을 훈련하고, 중앙 서버에 예측 결과와 노드 임베딩만 업로드합니다.
  • 서버는 클라이언트 간 예측을 집계하여 신뢰도 기준을 활용해 정확도가 높은 예측을 걸러내어 글로벌 가짜 레이블을 계산합니다.
  • 서버는 서로 유사하고 높은 신뢰도를 가진 예측을 가진 노드를 식별하고 연결하여 글로벌 가짜 그래프를 구축합니다.
  • 글로벌 가짜 레이블과 글로벌 가짜 그래프를 클라이언트에게 다시 배포하여 로컬 훈련 레이블을 풍부화하고 로컬 그래프 구조를 보강합니다.
  • 자기지도 학습 손실을 도입하여 주 작업 손실과 글로벌 가짜 레이블, 글로벌 가짜 그래프를 결합함으로써 일반화 성능을 향상시킵니다.
  • 자기지도 학습의 기여도와 주 작업 학습의 기여도를 균형 잡기 위해 초매개변수 α(자기지도 학습 강도)와 β(가짜 그래프 중요도)를 사용합니다.

실험 결과

연구 질문

  • RQ1데이터 이질성과 프라이버시 제약이 존재하는 상황에서 글로벌 자기지도 학습이 분산 그래프 학습의 성능을 향상시킬 수 있는가?
  • RQ2클라이언트 예측에서 유도된 글로벌 가짜 레이블의 사용이 로컬 및 글로벌 모델 정확도 향상에 얼마나 효과적인가?
  • RQ3로컬 그래프 구조에 글로벌 가짜 그래프를 보완함으로써 모델 일반화 성능이 얼마나 향상되는가?
  • RQ4신뢰도 기준 λ, 자기지도 학습 계수 α, 이웃 수 s와 같은 초매개변수들이 FedGL의 안정성과 성능에 미치는 영향은 어떠한가?
  • RQ5FedGL은 겹치지만 동일하지 않은 그래프 데이터를 가진 다양한 그래프 모델과 실제 세계 시나리오에 일반화될 수 있는가?

주요 결과

  • Citeseer 데이터셋에서 FedGL은 기존 분산 기반 기준 방법 대비 최소 5% 이상의 노드 분류 정확도 향상을 달성합니다. 이는 글로벌 가짜 레이블을 사용할 경우에 해당합니다.
  • 글로벌 가짜 레이블 생성에 최적의 신뢰도 기준 λ는 [0.1, 0.3] 범위 내에 있으며, 이 범위 내에서 성능이 안정적입니다.
  • 자기지도 학습 계수 α는 0.3 이하로 설정할 경우 가장 우수한 성능을 보이며, 이보다 높은 값은 자기지도 신호에 대한 과도한 강조로 인해 성능 저하를 초래합니다.
  • 글로벌 가짜 그래프 계수 β는 [0, 1] 범위에서 안정적인 성능을 보이며, 정확도에 심각한 하락이 없어, 가짜 그래프 통합 강도 변화에 대해 뛰어난 내구성을 보입니다.
  • 글로벌 가짜 그래프의 이웃 수 s는 성능에 미미한 영향을 미치며, s = 5에서 s = 1000에 이르기까지 안정적인 결과를 보이며 확장성과 내구성을 입증합니다.
  • FedGL은 네 가지 데이터셋(Cora, Citeseer, ACM, Wiki) 전반에서 중심화된 모델 및 단순 분산 기준 모델을 항상 앞서며, 실제 분산 그래프 학습 환경에서의 효과성을 확인합니다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.