[논문 리뷰] Server-Side Local Gradient Averaging and Learning Rate Acceleration for Scalable Split Learning
이 논문은 SGLR를 제안한다. SGLR는 분할 학습에서의 주요 병목 현상을 해결하기 위해 서버 측에서 국소 기울기 평균화(SplitAvg)와 학습률 분할(SplitLr)을 적용하는 확장 가능한 분할 학습 프레임워크이다. 서버에서 기울기를 평균화하고 클라이언트 및 서버의 학습률을 분리함으로써, SGLR는 기준선 SL 및 SFL보다 높은 정확도를 달성하면서도, SFL 대비 최대 88.6% 감소한 통신 오버헤드와 FL 대비 95.5% 감소한 통신 오버헤드를 기록한다. 성능는 FL과 유사하지만 에너지 소비와 통신 비용이 낮다.
In recent years, there have been great advances in the field of decentralized learning with private data. Federated learning (FL) and split learning (SL) are two spearheads possessing their pros and cons, and are suited for many user clients and large models, respectively. To enjoy both benefits, hybrid approaches such as SplitFed have emerged of late, yet their fundamentals have still been illusive. In this work, we first identify the fundamental bottlenecks of SL, and thereby propose a scalable SL framework, coined SGLR. The server under SGLR broadcasts a common gradient averaged at the split-layer, emulating FL without any additional communication across clients as opposed to SplitFed. Meanwhile, SGLR splits the learning rate into its server-side and client-side rates, and separately adjusts them to support many clients in parallel. Simulation results corroborate that SGLR achieves higher accuracy than other baseline SL methods including SplitFed, which is even on par with FL consuming higher energy and communication costs. As a secondary result, we observe greater reduction in leakage of sensitive information via mutual information using SLGR over the baselines.
연구 동기 및 목표
- 병렬 분할 학습에서의 확장성 한계, 특히 서버 측 대규모 유효 배치 크기 문제와 백워드 클라이언트 분리 문제를 해결하기 위해.
- 추가적인 통신 비용 없이도 많은 클라이언트 간에 효율적이고 확장 가능한 학습을 가능하게 하기 위해.
- 기존의 분할 학습 및 하이브리드 FL-SL 방법보다 모델 정확도를 향상시키고 정보 泄露를 줄이기 위해.
- 통신 및 에너지 오버헤드를 크게 줄이며, 동일한 성능을 달성하는 데 목적이 있다.
제안 방법
- SplitAvg를 도입한다: 분할 레이어에서 클라이언트 기울기를 서버 측에서 평균화하여, 모든 클라이언트에게 공통 기울기를 멀티캐스트 브로드캐스트할 수 있도록 한다.
- SplitLr를 제안한다: 학습률을 클라이언트 측 및 서버 측 구성요소로 분리하여 수렴 속도를 독립적으로 최적화한다.
- 서버에서 기울기 평균화를 통해 백워드 클라이언트 분리를 해결하여, 모든 클라이언트가 집단적 업데이트의 이점을 얻을 수 있도록 보장한다.
- 기울기를 배치당 한 번만 브로드캐스트하여, 클라이언트별 유니캐스트를 방지하는 통신 효율적인 아키텍처를 구현한다.
- 기존의 분할 학습 파이프라인을 활용하지만, 서버 측 기울기 집계 및 적응형 학습률을 통한 개선을 수행한다.
- 총 통신량과 학습 시간에 대한 폐쇄형 표현식을 사용하여 통신 오버헤드와 학습 시간을 분석한다.
실험 결과
연구 질문
- RQ1많은 클라이언트 간에 통신 비용 증가 없이 분할 학습을 어떻게 확장 가능하게 할 수 있는가?
- RQ2서버 측 기울기 평균화가 병렬 분할 학습에서 모델 수렴과 클라이언트 분리에 어떤 영향을 미치는가?
- RQ3학습률 분할이 대규모 모델을 가진 분할 학습 프레임워크에서 학습 안정성과 정확도를 향상시킬 수 있는가?
- RQ4SGLR는 정확도, 통신 비용, 개인정보 泄露 측면에서 플래거레이티드 러닝(FL)과 비교해 어떻게 성능를 내는가?
- RQ5기존의 분할 학습 및 하이브리드 FL-SL 방법 대비 SGLR의 이론적 통신 및 학습 시간 효율성 향상은 어느 정도인가?
주요 결과
- 100명의 클라이언트와 AlexNet 환경에서 SGLR는 SFL 대비 총 통신 오버헤드를 88.6% 감소시키고, FL 대비 95.5% 감소시켰다.
- SGLR는 통신 및 에너지 비용이 더 높은 FL에도 불구하고, FL과 동등한 정확도를 달성한다.
- SGLR의 학습 시간은 SL 및 SFL보다 일관되게 낮으며, 특히 모델 크기가 클 경우 FL과 경쟁 가능한 성능을 보인다.
- SGLR는 기준선 SL 및 SFL 방법보다 상호정보량을 통해 정보 泄露 감소 효과가 뚜렷하다.
- SGLR는 효율적인 기울기 브로드캐스트와 학습률 분리 덕분에 높은 확장성을 유지를 하며, 많은 클라이언트를 동시에 지원한다.
- 모델 크기가 클수록 로컬 데이터 크기가 과도하게 크지 않은 경우, 통신 효율성 향상 효과가 가장 두드러진다.
더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.