Skip to main content
QUICK REVIEW

[논문 리뷰] Federated Learning on Non-IID Graphs via Structural Knowledge Sharing

Yue Tan, Yixin Liu|arXiv (Cornell University)|2022. 11. 23.
Advanced Graph Neural Networks인용 수 10
한 줄 요약

FedStar는 독립적인 구조 인코더를 통해 구조적 표현을 명시적으로 학습하고 공유함으로써 구조적 지식과 특성 기반 지식을 분리하는 분산 그래프 학습 프레임워크를 제안한다. 이는 비독립 동일성(Non-IID) 그래프 환경에서 도메인 불변 구조적 지식을 포착하면서도 개인화된 특성 학습을 유지함으로써 뛰어난 성능을 달성한다.

ABSTRACT

Graph neural networks (GNNs) have shown their superiority in modeling graph data. Owing to the advantages of federated learning, federated graph learning (FGL) enables clients to train strong GNN models in a distributed manner without sharing their private data. A core challenge in federated systems is the non-IID problem, which also widely exists in real-world graph data. For example, local data of clients may come from diverse datasets or even domains, e.g., social networks and molecules, increasing the difficulty for FGL methods to capture commonly shared knowledge and learn a generalized encoder. From real-world graph datasets, we observe that some structural properties are shared by various domains, presenting great potential for sharing structural knowledge in FGL. Inspired by this, we propose FedStar, an FGL framework that extracts and shares the common underlying structure information for inter-graph federated learning tasks. To explicitly extract the structure information rather than encoding them along with the node features, we define structure embeddings and encode them with an independent structure encoder. Then, the structure encoder is shared across clients while the feature-based knowledge is learned in a personalized way, making FedStar capable of capturing more structure-based domain-invariant information and avoiding feature misalignment issues. We perform extensive experiments over both cross-dataset and cross-domain non-IID FGL settings, demonstrating the superiority of FedStar.

연구 동기 및 목표

  • 다양한 도메인에서 특성과 구조가 이질적인 그래프를 보유한 클라이언트들이 존재하는 비독립 동일성 그래프 데이터의 과제를 해결한다.
  • 이질적인 특성 공간 간에 특성 기반 표현을 집계하는 전통적인 FGL 방법의 한계를 극복하여 일반화 성능이 떨어지는 문제를 해결한다.
  • 다양한 그래프 도메인(예: 소셜 네트워크 및 분자) 간에 공유되는 일반적인 구조적 특성(예: 구조적 패턴)을 활용하여 원시 데이터를 공유하지 않고도 모델 일반화를 향상시킨다.
  • 구조와 특성 학습을 분리하여 특성 이질성으로부터 구조적 지식을 분리하고, 효과적인 지식 공유를 가능하게 하는 프레임워크를 설계한다.
  • 전역 구조 인코더를 공유하면서도 특성 인코더는 개인화함으로써 교차 데이터셋 및 교차 도메인 비독립 동일성 설정에서 더 높은 성능을 달성한다.

제안 방법

  • 구조적 표현을 그래프의 위상 구조를 명시적인 표현으로 정의하며, 노드 특성과는 별도로 전용 구조 인코더를 사용해 학습한다.
  • GNN을 두 구성 요소로 분리한다: 노드 속성에 대한 특성 인코더와 위상 패턴에 대한 구조 인코더로, 별도 최적화가 가능하도록 한다.
  • 연합 평균화 과정 동안 클라이언트 간에 훈련된 구조 인코더를 전역적으로 공유하며, 각 클라이언트는 로컬에서 자체 특성 인코더를 훈련한다.
  • 메시지 전파 과정에서 구조적 표현을 노드 특성 표현과 연결하여 노드 표현에 구조적 맥락을 강화한다.
  • 지역적 및 전역적 구조적 패턴을 모두 포착하기 위해 도로 기반 구조 인코딩(DSE)과 무작위 보행 기반 구조 인코딩(RWSE)을 조합한 이중 인코딩 전략을 사용한다.
  • 특성 인코더의 개인화를 유지하면서도 특성 정렬 오류를 방지하기 위해 구조 인코더 파라미터만 연합 평균화를 수행한다.

실험 결과

연구 질문

  • RQ1비독립 동일성 데이터 과제를 완화하기 위해 연합 그래프 학습에서 명시적인 구조적 지식을 클라이언트 간에 효과적으로 추출하고 공유할 수 있는가?
  • RQ2구조와 특성 학습을 분리함으로써 교차 도메인 및 교차 데이터셋 비독립 동일성 그래프 설정에서 모델 일반화 성능이 향상되는가?
  • RQ3특성 인코더는 개인화하면서도 구조 인코더만 공유할 경우, 전체 모델 또는 특성 전용 집계와 비교해 성능에 어떤 영향을 미치는가?
  • RQ4다양한 종류의 구조적 표현(예: DSE 대비 RWSE)이 이질적 그래프 환경에서 전체 성능에 기여하는 비율은 어떻게 되는가?
  • RQ5비독립 동일성 환경에서 클라이언트 수가 증가하고 로컬 훈련 에포크 수가 변할 경우 FedStar의 확장성은 어떻게 되는가?

주요 결과

  • FedStar는 BIO-CHEM(2)에서 74.54% ± 2.50의 F1 스코어, BIO-CHEM-SN(3)에서 72.15% ± 2.43, BIO-SN-CV(3)에서 69.49% ± 1.81를 기록하여 모든 교차 도메인 비독립 동일성 설정에서 FedAvg 및 GCFL를 능가한다.
  • 제거 실험 결과, DSE와 RWSE를 조합할 경우 최고의 성능를 기록하며, 도메인 불변 구조적 패턴을 포착하는 데 DSE가 RWSE보다 더 큰 기여를 한다.
  • 구조 인코더만 공유할 경우 성능이 가장 높으며, 모든 파라미터나 특성 인코더만 공유할 경우 특성 이질성으로 인해 성능 저하가 발생한다.
  • FedStar는 FedAvg나 GCFL보다 더 많은 로컬 에포크 수에서 더 큰 이점을 얻으며, CHEM 비독립 동일성 설정에서 4개의 로컬 에포크로 80.58% ± 2.48의 F1 스코어를 달성한다.
  • 클라이언트 수가 7에서 84로 증가함에 따라 FedStar는 뛰어난 성능를 유지하며, 대규모 FGL 시스템에서의 강건성과 확장성을 입증한다.
  • 소규모 및 대규모 비독립 동일성 설정 모두에서 로컬 훈련 및 기존 최신 기술(SOTA) 방법보다 우수한 성능를 기록하며, 다양한 그래프 도메인에서 일관된 성능 향상을 보여준다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.