Skip to main content
QUICK REVIEW

[논문 리뷰] Federated Learning on Non-IID Data: A Survey

Hangyu Zhu, Jinjin Xu|arXiv (Cornell University)|2021. 06. 12.
Privacy-Preserving Technologies in Data참고 문헌 154인용 수 8
한 줄 요약

이 종합 검토는 수평적 및 수직적 플러딩 러닝 환경에서 파arametric 및 비모수적 모델에 영향을 미치는 비i.i.d.(독립 동일 분포가 아닌) 데이터에 대한 포괄적인 분석을 제공한다. 데이터 편향으로 인한 성능 저하를 완화하기 위한 기존 기법들을 검토하고, 기밀성, 계산, 통신 간의 트레이드오프를 평가하며, 개인화된 플러딩 러닝, 벤치마킹, 연합 신경망 아키텍처 탐색 분야에서의 핵심 열린 과제와 향후 연구 방향을 규명한다.

ABSTRACT

Federated learning is an emerging distributed machine learning framework for privacy preservation. However, models trained in federated learning usually have worse performance than those trained in the standard centralized learning mode, especially when the training data are not independent and identically distributed (Non-IID) on the local devices. In this survey, we pro-vide a detailed analysis of the influence of Non-IID data on both parametric and non-parametric machine learning models in both horizontal and vertical federated learning. In addition, cur-rent research work on handling challenges of Non-IID data in federated learning are reviewed, and both advantages and disadvantages of these approaches are discussed. Finally, we suggest several future research directions before concluding the paper.

연구 동기 및 목표

  • 비i.i.d. 데이터 분포가 수평적 및 수직적 플러딩 러닝 프레임워크 전반에 걸쳐 플러딩 러닝 성능에 미치는 영향을 체계적으로 분석하기 위해.
  • 기존의 비i.i.d. 데이터 처리 방법들을 데이터 공유, 지식 정복, 개인화, 클라이언트 군집화 등을 포함해 분류하고 평가하기 위해.
  • 비i.i.d. 플러딩 러닝 환경에서 모델 정확도, 통신 비용, 계산 오버헤드, 기밀성 유출 간의 핵심 트레이드오프를 규명하기 위해.
  • 수직 플러딩 러닝 및 연합 신경망 아키텍처 탐색에서 이질적 데이터 지원, 벤치마킹, 기밀성 정량화 분야에서의 열린 과제를 부각하기 위해.
  • 표준화된 벤치마크, 기밀성 인식 메트릭, 비i.i.d. 인식 연합 신경망 아키텍처 탐색을 포함한 향후 연구 방향을 제안하기 위해.

제안 방법

  • 비i.i.d. 데이터를 수평적 및 수직적 플러딩 러닝 환경으로 분류하고, 레이블 편향, 개념 이동, 기능 겹침 등의 하위 유형을 포함한다.
  • 비i.i.d. 데이터가 딥 네URAL 네트워크 및 비모수적 모델에 대해 모델 수렴과 성능에 미치는 영향을 분석한다.
  • 기존 완화 기법들을 데이터 수준, 모델 수준, 시스템 수준의 접근 방식으로 분류하고, 지역적 피니튜닝, 클라이언트 군집화, 개인화된 플러딩 러닝 등을 포함하여 검토한다.
  • 통신, 계산, 기밀성 간의 트레이드오프를 기반으로 기법들을 평가하며, 많은 기법들이 정확도 향상을 이끌지만 기밀성 위험을 증가시킨다는 점을 부각한다.
  • 실제 세계 데이터 분포와 합성 편향 방법을 활용한 비i.i.d. 영향 평가 프레임워크를 제안한다.
  • 수직 플러딩 러닝에서의 비i.i.d. 시나리오에 대한 분류 체계를 도입하며, 이전에 문헌에서 다루지 않은 요소인 기능 겹침과 컨소시엄 편향을 포함한다.

실험 결과

연구 질문

  • RQ1레이블 편향, 기능 편향 등의 다양한 비i.i.d. 데이터 분포 유형이 수평적 플러딩 러닝에서 모델 수렴과 성능에 어떤 영향을 미치는가?
  • RQ2데이터 공유 및 지식 정복과 같은 비i.i.d. 플러딩 러닝 완화 기법에서 성능 향상과 기밀성 위험 간의 트레이드오프는 무엇인가?
  • RQ3표준 플러딩 평균 알고리즘이 비i.i.d. 데이터에서 실패하는 이유는 무엇이며, 지역 모델에서 가중치 분산이 어떻게 발생하는가?
  • RQ4특히 기능 겹침 또는 이질적 기능이 있는 수직 플러딩 러닝에서 비i.i.d. 플러딩 러닝 성능 평가의 핵심 과제는 무엇인가?
  • RQ5연합 신경망 아키텍처 탐색(FNAS)은 비i.i.d. 데이터를 어떻게 다룰 수 있으며, 이 분야에서의 열린 연구 과제는 무엇인가?

주요 결과

  • 비i.i.d. 데이터는 특히 딥 네URAL 네트워크에서 지역 모델의 가중치 분산으로 인해 플러딩 러닝 성능을 심각하게 저하시킨다.
  • 지역적 피니튜닝 및 데이터 공유와 같은 기법들은 수렴을 향상시키지만, 통신 및 계산 비용을 증가시키거나 데이터 기밀성을 해칠 수 있다.
  • 개인화 및 클라이언트 군집화 기법들은 원래의 플러딩 러닝 프레임워크를 변화시켜 모든 클라이언트에 대해 단일 글로벌 모델을 구현하는 것이 불가능하게 만든다.
  • 비i.i.d. 플러딩 러닝을 위한 기존의 벤치마크는 부적절하며, 합성 데이터 분할 방식이 실제 세계의 데이터 편향 패턴을 반영하지 못한다.
  • 데이터 공유 및 지식 정복 기법으로 인한 기밀성 누출에 대한 정량적 측정이 부족하여 주요 열린 과제로 남아 있다.
  • 실제 응용에서 흔한 기능 겹침 또는 속성-레이블 편향을 포함한 수직 플러딩 러닝은 여전히 다루지 않은 분야에 속한다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.