Skip to main content
QUICK REVIEW

[논문 리뷰] Device Heterogeneity in Federated Learning: A Superquantile Approach

Yassine Laguel, Krishna Pillutla|arXiv (Cornell University)|2020. 02. 25.
Privacy-Preserving Technologies in Data참고 문헌 38인용 수 14
한 줄 요약

이 논문은 장치 이질성을 고려하여 초과분위수 기반 목적함수를 매개변수화한 Δ-FL을 제안한다. 이 목적함수의 매개변수는 적합도 수준을 나타내며, 비적합 사용자에게 개인화된 모델을 제공한다. 이 방법은 안전한 집계를 사용하고, FedAvg와 유사한 통신 비용을 가지며, 수렴성이 보장되는 알고리즘을 적용하여 평균 성능을 희생시키지 않은 채 꼬리 오차 성능을 뛰어나게 향상시킨다.

ABSTRACT

We propose a federated learning framework to handle heterogeneous client devices which do not conform to the population data distribution. The approach hinges upon a parameterized superquantile-based objective, where the parameter ranges over levels of conformity. We present an optimization algorithm and establish its convergence to a stationary point. We show how to practically implement it using secure aggregation by interleaving iterations of the usual federated averaging method with device filtering. We conclude with numerical experiments on neural networks as well as linear models on tasks from computer vision and natural language processing.

연구 동기 및 목표

  • 클라이언트 데이터 분포가 인구 분포에서 벗어나는 통계적 이질성을 다루기 위해.
  • 적합한 사용자에게 성능이 떨어지지 않도록 비적합한 사용자(예: 트렌드 세터, 지역 사용자)의 모델 성능을 향상시키기 위해.
  • FedAvg와 유사한 통신 효율성을 유지하면서도 확장 가능하고 프라이버시를 보장하는 최적화 방법을 개발하기 위해.
  • 각 장치별로 적합도 노브를 조정하여 테스트 시 개인화된 추론을 가능하게 하기 위해.
  • 비연속, 비볼록 목적함수 하에서 제안된 알고리즘이 정적점으로 수렴하는 것을 이론적으로 확립하기 위해.

제안 방법

  • 손실 분포에 대해 매개변수화된 초과분위수 목적함수를 사용하며, 이 매개변수는 장치의 인구에 대한 적합도 수준을 나타낸다.
  • 손실 분포의 초과분위수를 매끄럽게 처리하는 기법을 활용해, 모델 파라미터 업데이트와 초과분위수 추정을 번갈아 수행하는 새로운 최적화 알고리즘을 제안한다.
  • 초과분위수의 비연속성 문제를 다루기 위해 최소합성(smoothing) 기법을 활용하여 기울기 기반 업데이트를 가능하게 한다.
  • 안전한 집계는 FedAvg 스타일의 라운드를 장치 적합도 추정 기반 필터링과 번갈아 수행함으로써 통합된다.
  • 표준 안전한 집계 원리를 재사용함으로써, 반복당 통신 비용이 FedAvg와 동일하게 유지된다.
  • 학습 중에 낮은 적합도 장치를 제외하여 초과분위수 추정에 기여하지 않도록 함으로써, 강인성을 향상시킨다.

실험 결과

연구 질문

  • RQ1초과분위수 기반 목적함수는 분산 학습에서 비적합 사용자의 모델 성능을 효과적으로 향상시킬 수 있는가?
  • RQ2통신 및 프라이버시 제약 조건 하에서 비연속적인 초과분위수 목적함수를 효율적으로 최적화할 수 있는가?
  • RQ3중요한 꼬리 손실 분포가 존재할 때, 장치 필터링은 수렴성과 성능에 어떤 영향을 미치는가?
  • RQ4제안된 방법은 FedAvg와 유사한 통신 효율성을 유지하면서도 개인화를 가능하게 할 수 있는가?
  • RQ5초과분위수 매개변수의 업데이트 주기 선택이 수렴성과 일반화에 어떤 영향을 미치는가?

주요 결과

  • Δ-FL은 신경망에서 비적합 장치의 오분류 오차 분산을 감소시키며, 특히 오차의 상위 분위수에서 두드러진 향상을 보였다.
  • EMNIST와 Sent140에서 Δ-FL은 평균 오차 성능이 경쟁력 있음을 유지하면서도, 테스트 오차의 90번째 백분위수에서 FedAvg를 뛰어나게 성능을 냈다.
  • 장치 필터링은 각 라운드당 선택된 장치 수를 안정화시키며, 5회 랜덤 실행 동안 최소한의 변동성을 보여, 강인성을 입증했다.
  • EMNIST 선형 모델에서 초과분위수 매개변수의 업데이트 주기(Tη)를 늘릴수록 성능 향상이 있었으며, 이는 최적화 빈도에 민감함을 시사했다.
  • 알고리즘은 거의 확실히 정적점으로 수렴하며, 최소합성(smoothing)과 하위미분 분석을 통해 이론적 보장을 확보했다.
  • 프레임워크는 적합도 노브를 통해 테스트 시 개인화된 추론을 가능하게 하여, 사용자가 자신의 데이터 분포에 맞는 모델을 선택할 수 있도록 했다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.