Skip to main content
QUICK REVIEW

[논문 리뷰] Federated Graph Machine Learning: A Survey of Concepts, Techniques, and Applications

Xingbo Fu, Binchi Zhang|arXiv (Cornell University)|2022. 07. 24.
Privacy-Preserving Technologies in Data인용 수 13
한 줄 요약

이 종합 검토는 분산된 개인정보 민감성 데이터 소스 간에 그래프 신경망을 훈련하기 위한 해결책으로 연합 그래프 기계학습(FedGML)을 소개한다. 이 논문은 '구조화된 데이터를 활용한 FL'과 '구조화된 FL'으로 나누는 새로운 분류 체계를 제안하며, 핵심 기법, 응용 분야, 데이터셋, 플랫폼을 검토하고, 데이터 이질성, 프라이버시 泄露, 통신 오버헤드, 공정성, 보안성 등의 열린 과제를 밝혀내어未래 연구를 위한 종합적인 로드맵을 제공한다.

ABSTRACT

Graph machine learning has gained great attention in both academia and industry recently. Most of the graph machine learning models, such as Graph Neural Networks (GNNs), are trained over massive graph data. However, in many real-world scenarios, such as hospitalization prediction in healthcare systems, the graph data is usually stored at multiple data owners and cannot be directly accessed by any other parties due to privacy concerns and regulation restrictions. Federated Graph Machine Learning (FGML) is a promising solution to tackle this challenge by training graph machine learning models in a federated manner. In this survey, we conduct a comprehensive review of the literature in FGML. Specifically, we first provide a new taxonomy to divide the existing problems in FGML into two settings, namely, FL with structured data and structured FL. Then, we review the mainstream techniques in each setting and elaborate on how they address the challenges under FGML. In addition, we summarize the real-world applications of FGML from different domains and introduce open graph datasets and platforms adopted in FGML. Finally, we present several limitations in the existing studies with promising research directions in this field.

연구 동기 및 목표

  • 다양한 클라이언트 간에 분산되어 있는 개인정보 민감성 그래프 데이터에서 그래프 기계학습 모델을 훈련하는 데 도전 과제를 해결하기 위해.
  • 클라이언트 간 그래프 구조의 역할에 기반해 '구조화된 데이터를 활용한 FL'과 '구조화된 FL'을 구분하는 새로운 분류 체계를 제안하기 위해.
  • FGML에서 클라이언트 간 누락된 정보, 구조적 프라이버시 泄露, 데이터 이질성 문제를 다루는 기존 기법들을 체계적으로 검토하기 위해.
  • 의료, 금융, 바이오인포매틱스, 추천 시스템 분야에서의 FGML 실세계 응용 사례를 요약하기 위해.
  • 통신 효율성, 공정성, 악성 공격에 대한 강건성 등의 과제를 식별하고未래 연구 방향을 제안하기 위해.

제안 방법

  • 이중 계층 분류 체계를 제안: '구조화된 데이터를 활용한 FL'(클라이언트는 제한된 이웃 액세스로 국소 서브그래프에서 훈련)와 '구조화된 FL'(클라이언트 간 정보 공유를 가능하게 하는 고차원 클라이언트 그래프 형성).
  • 클라이언트 경계를 넘는 메시지 전달 및 표현 보완 전략 등을 통해 클라이언트 간 누락된 정보 문제를 완화하는 기법을 검토.
  • 노드 임베딩의 안전한 집계 및 차등적 프라이버시와 같은 구조적 프라이버시 보존 메커니즘을 분석.
  • 적응형 집계 및 클라이언트별 모델 개인화 전략 등을 통해 그래프 구조의 데이터 이질성 문제를 다루는 방법을 검토.
  • 그래프 특성에 맞는 의존성에 맞춰 조정된 모델 압축 및 로컬 업데이트 스케줄링과 같은 통신 감소 전략 평가.
  • Open-source 플랫폼인 FederatedScope-GNN과 FedGraphNN을 도입하고 평가하며, FGML 연구를 위한 공개 그래프 데이터셋의 가용성도 강조.

실험 결과

연구 질문

  • RQ1개인정보 제약 조건이 있는 다수의 클라이언트에 분산된 그래프 데이터에서 그래프 기계학습 모델을 효과적으로 훈련할 수 있는 방법은 무엇인가?
  • RQ2구조화된 데이터를 활용한 FL과 구조화된 FL 간의 핵심 차이점은 무엇이며, 이는 모델 설계 및 최적화에 어떻게 영향을 미치는가?
  • RQ3연합 훈련 중에 노드 특성 외에도 그래프 구조적 정보의 프라이버시를 어떻게 보존할 수 있는가?
  • RQ4비독립 동일분포(Non-IID) 그래프 구조와 클라이언트 간 누락된 이웃 정보로 인한 성능 저하를 완화할 수 있는 기법은 무엇인가?
  • RQ5FGML 분야의 주요 열린 과제는 무엇이며,未래 연구는 통신 효율성, 공정성, 보안성 문제를 어떻게 해결할 수 있는가?

주요 결과

  • 이 검토는 두 가지 주요 FGML 설정을 식별한다: '구조화된 데이터를 활용한 FL'과 '구조화된 FL'로, 각각 데이터 및 구조적 프라이버시 문제를 다루기 위해 별도의 기술적 접근이 필요하다.
  • 클라이언트 간 누락된 정보 문제는 여전히 주요 과제로 남아 있으며, 노드가 다른 클라이언트에 위치한 이웃의 특성을 액세스할 수 없어 표현이 불완전해지는 데 기인한다.
  • 구조적 프라이버시 泄露는 심각한 문제로, 인접 행렬과 노드 임베딩은 전송 시 민감한 관계를 드러낼 수 있다.
  • 기존 FGML의 통신 전략은 표준 FL 대비 효율성이 떨어지며, 노드 수준과 클라이언트 수준의 그래프 구조를 모두 고려해 정보를 전파해야 하기 때문이다.
  • FGML에서의 공정성 문제는 아직 충분히 탐구되지 않았으며, 클라이언트 간 구조적 차이가 그룹 간 모델 성능 편향을 증폭시킬 수 있다.
  • 현재 FGML를 위한 벤치마크 및 플랫폼은 제한되어 있으며, 현실적이고 대규모 분산 그래프 데이터를 제공하지 않아 재현 가능하고 실용적인 연구를 방해하고 있다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.