Skip to main content
QUICK REVIEW

[논문 리뷰] Prototype Helps Federated Learning: Towards Faster Convergence

Yu Qiao, Seong-Bae Park|arXiv (Cornell University)|2023. 03. 22.
Privacy-Preserving Technologies in Data인용 수 7
한 줄 요약

이 논문은 최종 학습 라운드에서 클라이언트로부터의 클래스 프로토타입을 집계하여 분류기 헤드에 대한 의존도를 제거함으로써 모델 추론을 향상시키는 프로토타입 기반 연합 학습 프레임워크를 제안한다. 국소 모델의 전처리 층에서 프로토타입을 계산하고 평균화함으로써, 이 방법은 MNIST 및 패션-MNIST에서 비독립 동일 분포(non-IID) 환경에서 FedAvg 및 로컬 기준선 대비 최소 1% 이상의 높은 테스트 정확도와 더 빠른 수렴 속도를 달성한다.

ABSTRACT

Federated learning (FL) is a distributed machine learning technique in which multiple clients cooperate to train a shared model without exchanging their raw data. However, heterogeneity of data distribution among clients usually leads to poor model inference. In this paper, a prototype-based federated learning framework is proposed, which can achieve better inference performance with only a few changes to the last global iteration of the typical federated learning process. In the last iteration, the server aggregates the prototypes transmitted from distributed clients and then sends them back to local clients for their respective model inferences. Experiments on two baseline datasets show that our proposal can achieve higher accuracy (at least 1%) and relatively efficient communication than two popular baselines under different heterogeneous settings.

연구 동기 및 목표

  • 클라이언트 간 비독립 동일 분포 데이터 분포로 인한 연합 학습에서의 낮은 모델 추론 성능 문제를 해결한다.
  • 특히 데이터 이질성 하에서 분류기 레이어로 인한 예측 편향을 감소시킨다.
  • 표준 연합 학습 학습 파이프라인의 수정이 최종 라운드를 제외하고는 필요 없이 수렴 속도와 테스트 정확도를 향상시킨다.
  • 추가 오버헤드를 최소화하면서 클래스 프로토타입을 활용하는 통신 효율적인 방법을 도입한다.
  • 이질적인 연합 학습 환경에서 표준 분류기 기반 추론보다 프로토타입 기반 추론이 더 우수한 성능을 보임을 입증한다.

제안 방법

  • 클라이언트는 로컬 데이터에서 동일한 클래스에 속하는 샘플의 전처리 층 특징을 평균하여 각 클래스의 프로토타입을 계산한다.
  • 최종 글로벌 라운드에서 클라이언트는 모델 파라미터와 함께 클래스 프로토타입을 서버로 업로드하여 집계한다.
  • 서버는 식 (3)을 사용하여 모든 클라이언트의 프로토타입을 평균화하여 글로벌 프로토타입을 계산한다.
  • 추론 시, 입력의 전처리 층 출력과 글로벌 프로토타입 간의 L2 거리가 가장 작은 클래스를 예측한다. 이는 식 (4)에 정의되어 있다.
  • 이 방법은 표준 연합 학습에 원활하게 통합되며, 통신 및 추론 과정에서 최종 라운드만 표준 방식과 다릅니다.
  • 평가를 위해 MNIST 및 패션-MNIST에서 두 개의 컨볼루션 층과 두 개의 완전 연결 층을 포함하는 4층의 CNN을 사용한다.

실험 결과

연구 질문

  • RQ1비독립 동일 분포 데이터 분포 하에서 프로토타입 기반 추론이 연합 학습에서 모델 정확도를 향상시킬 수 있는가?
  • RQ2최종 라운드에서 클래스 프로토타입을 집계하는 것이 표준 연합 학습 방법 대비 더 빠른 수렴을 이끌어내는가?
  • RQ3다양한 데이터 왜곡 수준 하에서 제안된 방법이 FedAvg 및 로컬 학습 대비 정확도 및 통신 효율성에서 어떻게 비교되는가?
  • RQ4프로토타입 집계가 연합 학습 모델의 분류기 레이어에서 유도하는 편향을 완화시킬 수 있는가?
  • RQ5프로토타입 기반 추론 전략은 다양한 데이터셋과 데이터 이질성 수준에서 효과적인가?

주요 결과

  • α = 0.05일 때 MNIST에서 제안된 방법은 로컬 기준선 대비 18.9% 높은 정확도를 기록했고, FedAvg 대비 2.4% 높았다.
  • α = 0.1일 때 MNIST에서 제안된 방법은 로컬 기준선 대비 31.5% 높은 정확도를 기록했고, FedAvg 대비 1.0% 높았다.
  • α = 0.05일 때 패션-MNIST에서 제안된 방법은 로컬 기준선 대비 1.4% 높은 정확도를 기록했고, FedAvg 대비 14.3% 높았다.
  • α = 0.1일 때 패션-MNIST에서 제안된 방법은 로컬 기준선 대비 18.4% 높은 정확도를 기록했고, FedAvg 대비 7.4% 높았다.
  • 모든 테스트된 비독립 동일 분포 설정에서 제안된 방법은 두 기준선 대비 최소 1% 이상의 높은 테스트 정확도를 지속적으로 달성했다.
  • 이 방법은 통신 라운드 당 테스트 정확도 수렴 속도가 상대적으로 더 빠르게 나타나, 통신 효율성이 향상됨을 보였다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.