[논문 리뷰] Adaptive Parameterization of Deep Learning Models for Federated Learning
이 논문은 비편향 데이터 분포를 가진 크로스실로 및 크로스디바이스 FL 환경에서 통신 오버헤드를 최대 90%까지 줄이면서 전체 모델 미세조정 수준의 추론 성능을 유지하기 위해 연속 어댑터를 사용하는 것을 제안한다. 클라이언트는 오직 작은 작업별 모듈인 어댑터 파라미터만 훈련하고, 이로 인해 교환하는 데이터량을 최소화함으로써 대역폭 소비를 크게 줄인다.
Federated Learning offers a way to train deep neural networks in a distributed fashion. While this addresses limitations related to distributed data, it incurs a communication overhead as the model parameters or gradients need to be exchanged regularly during training. This can be an issue with large scale distribution of learning tasks and negate the benefit of the respective resource distribution. In this paper, we we propose to utilise parallel Adapters for Federated Learning. Using various datasets, we show that Adapters can be incorporated to different Federated Learning techniques. We highlight that our approach can achieve similar inference performance compared to training the full model while reducing the communication overhead by roughly 90%. We further explore the applicability of Adapters in cross-silo and cross-device settings, as well as different non-IID data distributions.
연구 동기 및 목표
- 훈련 라운드 동안 클라이언트와 서버 간 전송되는 데이터를 최소화하여 피드럴러닝의 통신 오버헤드를 줄이는 것.
- 전체 모델 미세조정 수준의 높은 추론 성능을 유지하면서 오직 경량 어댑터 파라미터만 교환하는 것.
- 다양한 비편향 데이터 분포 하에서 크로스실로 및 크로스디바이스 피드럴러닝 설정에서 어댑터의 효과성을 평가하는 것.
- 전체 모델 가중치 대신 어댑터만 교환할 경우의 보안성 및 확장성 이점 탐색.
- 기존 피드럴러닝 알고리즘에 기반 모델을 수정하지 않고도 어댑터를 플러그인 방식으로 통합할 수 있음을 보여주는 것.
제안 방법
- 사전 훈련된 도메인에 관계없는 기본 모델에 경량으로 훈련 가능한 모듈인 병렬 어댑터를 삽입한다.
- 피드럴러닝 라운드 동안 기본 모델 가중치는 동결해 유지하고 오직 어댑터 파라미터만 훈련한다.
- 클라이언트와 서버 간에 오직 어댑터의 state_dicts만 교환하여 페이로드 크기를 22.2 MB(전체 모델)에서 2.58 MB(어댑터 전용)로 줄인다.
- 기본 피드럴러닝 알고리즘으로 FedAvg, FedProx, FedNova를 사용하고 어댑터를 추가 구성요소로 통합한다.
- 크로스디바이스 및 크로스실로 설정 모두에서 비편향 데이터를 시뮬레이션하기 위해 레이블 분포 편향과 특징 분포 편향을 적용한다.
- 모든 클라이언트에서 일관된 시작점을 확보하기 위해 어댑터를 중앙에서 초기화하여 모델 정렬을 유지한다.
실험 결과
연구 질문
- RQ1어댑터는 모델 정확도를 희생시키지 않고 피드럴러닝의 통신 오버헤드를 줄일 수 있는가?
- RQ2레이블 편향 및 특징 편향과 같은 다양한 비편향 데이터 분포 하에서 어댑터 기반 피드럴러닝의 성능은 어떻게 되는가?
- RQ3어댑터를 사용할 경우와 전체 모델 미세조정을 비교했을 때 통신 비용과 추론 성능 간의 상충 관계는 어떠한가?
- RQ4다양한 클라이언트 참여도 및 자원 제약 조건 하에서 크로스실로 및 크로스디바이스 피드럴러닝 설정에서 이 방법은 어떻게 확장되는가?
- RQ5기본 모델 가중치 노출을 제한함으로써 어댑터가 피드럴러닝의 보안성을 향상시킬 수 있는가?
주요 결과
- 제안된 어댑터 기반 피드럴러닝 접근법은 통신 오버헤드를 약 90% 감소시켜 페이로드 크기를 전체 모델일 경우 22.2 MB에서 어댑터 전용일 경우 2.58 MB로 줄였다.
- FedAvg, FedProx, FedNova를 포함한 여러 데이터셋과 피드럴러닝 알고리즘에서 어댑터 기반 피드럴러닝은 전체 모델 미세조정과 동등한 추론 성능를 달성했다.
- 양적 레이블 불균형(M=1, 극단적 클래스 불균형) 상황에서는 전체 미세조정과 어댑터 훈련 모두 수렴이 어려운 경향이 있으나, 어댑터 훈련은 낮은 학습률에서 안정성을 유지했다.
- 분포 기반 레이블 불균형 상황에서는 어댑터 기반 피드럴러닝이 전체 미세조정 대비 더 두드러진 성능 격차를 보였으며, 이는 일부 비편향 패턴에 민감함을 시사한다.
- 이 방법은 기존 피드럴러닝 알고리즘과 호환되며 기반 모델 아키텍처를 수정하지 않고도 플러그인 솔루션으로 사용할 수 있다.
- 어댑터는 기밀성 보장을 높여주며, 가로채진 전송 내용이 기능을 갖춘 어댑터 가중치가 아니므로 기반 모델이 없이선 유용하지 않다는 점에서 보안성을 향상시킨다.
더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.