[논문 리뷰] FedBN: Federated Learning on Non-IID Features via Local Batch Normalization
FedBN은 연합 학습에서 Batch Normalization 파라미터를 로컬로 유지하여 특징 이동(non-IID 데이터)을 해결하고, 벤치마크와 실제 데이터 세트 전반에서 FedAvg 및 FedProx보다 수렴 속도와 정확도를 향상시킵니다.
The emerging paradigm of federated learning (FL) strives to enable collaborative training of deep models on the network edge without centrally aggregating raw data and hence improving data privacy. In most cases, the assumption of independent and identically distributed samples across local clients does not hold for federated learning setups. Under this setting, neural network training performance may vary significantly according to the data distribution and even hurt training convergence. Most of the previous work has focused on a difference in the distribution of labels or client shifts. Unlike those settings, we address an important problem of FL, e.g., different scanners/sensors in medical imaging, different scenery distribution in autonomous driving (highway vs. city), where local clients store examples with different distributions compared to other clients, which we denote as feature shift non-iid. In this work, we propose an effective method that uses local batch normalization to alleviate the feature shift before averaging models. The resulting scheme, called FedBN, outperforms both classical FedAvg, as well as the state-of-the-art for non-iid data (FedProx) on our extensive experiments. These empirical results are supported by a convergence analysis that shows in a simplified setting that FedBN has a faster convergence rate than FedAvg. Code is available at https://github.com/med-air/FedBN.
연구 동기 및 목표
- 클라이언트마다 로컬 특징 분포가 다른 연합 학습에서 특징 이동(non-IID)을 동기 부여하고 해결한다.
- BN 파라미터를 로컬로 유지하고(평균화하지 않음) 비-BN 계층에는 FedAvg를 사용함으로써 특징 이동을 완화하는 경량화된 방법을 제안한다.
- 특징 이동하에서 FedAvg보다 더 빠른 수렴을 보이는 이론적 수렴 분석을 제공한다.
- 벤치마크 및 실제 데이터세트에서 FedBN을 실증적으로 검증하고 FedAvg 및 FedProx에 비해 명확한 개선을 보인다.
제안 방법
- 로컬 업데이트를 수행하고 비-BN 계층을 집계하는 한편 BN 파라미터는 엄격하게 로컬로 유지되어 전달되지 않는 FedBN을 도입한다.
- 2층 네트워크와 아키텍처의 일부로 배치 정규화를 포함한 모델 형식과 BN 파라미터 평균화를 생략하는 FedBN 목적식을 정의한다.
- 뉴럴 탠전트 커널(NTK) 프레임워크를 활용한 수렴 분석으로 FedBN의 수렴이 보조 Gram 행렬의 최소 고유값에 의해 좌우되며, 특징 이동 설정에서 FedBN이 FedAvg보다 더 빠른 수렴 속도를 달성한다.
- 데이터 규칙과 이질성의 변화에 따른 수렴 특성 및 정확도를 포함하여 벤치마크 및 실제 데이터셋에서 FedBN과 FedAvg, FedProx, SingleSet를 비교하는 실험 프로토콜.
실험 결과
연구 질문
- RQ1연합 학습에서 특징 이동이 FedAvg의 성능 저하를 유발하는가, 그리고 로컬 BN이 이 저하를 완화할 수 있는가?
- RQ2특징 이동 비동일 데이터 하에서 FedBN이 FedAvg 및 FedProx에 비해 수렴 속도와 최종 정확도를 개선할 수 있는가?
- RQ3다양한 이질성 정도를 가진 벤치마크 도메인과 실제 데이터세트에서 FedBN의 성능은 어떠한가?
- RQ4다양한 로컬 업데이트 주기와 클라이언트 데이터 크기에 대해 FedBN은 로버스트한가?
주요 결과
- FedBN은 특징 이동 non-IID 설정에서 벤치마크 및 실제 데이터세트에서 일관되게 FedAvg 및 FedProx를 능가한다.
- 실험에서 FedBN은 FedAvg보다 더 빠른 수렴과 더 안정된 손실 곡선을 보인다.
- 특징 이동이 더 뚜렷한 데이터셋(예: SVHN)에서 더 큰 정확도 향상을 보이고 실행 간 분산은 더 낮게 유지된다.
- 실제 작업들(Office-Caltech10, DomainNet, ABIDE)에서 FedBN은 다중 클라이언트/데이터세트에 걸쳐 대안들보다 더 높은 평균 정확도를 달성한다.
- 이론적 분석에 의하면 FedBN은 특징 이동 하에서 G-지배 체제에서 FedAvg보다 더 빠른 수렴 속도를 가진다고 제시한다.
더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.