[논문 리뷰] FLuID: Mitigating Stragglers in Federated Learning using Invariant Dropout
FLuID는 동적으로 하위 모델을 정리하는 기법인 Invariant Dropout를 도입하여 연합 학습에서 영향력이 낮고 변화가 없는 뉘런을 식별하고 제거함으로써 느린 기기(스트래글러 기기)의 계산 부담을 줄입니다. 비스트래글러 기기의 업데이트를 활용해 런타임 중 하위 모델을 프로파일링하고 적응적으로 조정함으로써, 최신 기술 대비 최대 18% 빠른 학습 속도를 달성하면서 정확도를 향상시키며, 모델 효율성을 유지하고 오버헤드를 최소화합니다.
Federated Learning (FL) allows machine learning models to train locally on individual mobile devices, synchronizing model updates via a shared server. This approach safeguards user privacy; however, it also generates a heterogeneous training environment due to the varying performance capabilities across devices. As a result, straggler devices with lower performance often dictate the overall training time in FL. In this work, we aim to alleviate this performance bottleneck due to stragglers by dynamically balancing the training load across the system. We introduce Invariant Dropout, a method that extracts a sub-model based on the weight update threshold, thereby minimizing potential impacts on accuracy. Building on this dropout technique, we develop an adaptive training framework, Federated Learning using Invariant Dropout (FLuID). FLuID offers a lightweight sub-model extraction to regulate computational intensity, thereby reducing the load on straggler devices without affecting model quality. Our method leverages neuron updates from non-straggler devices to construct a tailored sub-model for each straggler based on client performance profiling. Furthermore, FLuID can dynamically adapt to changes in stragglers as runtime conditions shift. We evaluate FLuID using five real-world mobile clients. The evaluations show that Invariant Dropout maintains baseline model efficiency while alleviating the performance bottleneck of stragglers through a dynamic, runtime approach.
연구 동기 및 목표
- 기기 이질성으로 인한 스트래글러 기기로 인한 성능 저하 문제를 해결하기 위해.
- 클라이언트의 능력에 맞게 하위 모델을 동적으로 조정함으로써 학습 지연을 줄이고 정확도를 손상시키지 않기 위해.
- 스트래글러 조건 변화에 따라 실시간으로 재보정하는 경량의 런타임 적응 프레임워크를 개발하기 위해.
- 전체 클라이언트나 고정된 모델 부분을 제거하는 대신, 오직 변화가 없는 뉘런만 선택적으로 제거함으로써 클라이언트 기여를 유지하고 학습 편향을 방지하기 위해.
제안 방법
- Invariant Dropout은 학습 반복 동안 최소한의 가중치 업데이트를 보이는(즉, 변화가 없는) 뉘런을 식별합니다. 이러한 뉘런은 모델 성능에 거의 기여하지 않습니다.
- 서버는 비스트래글러 클라이언트의 업데이트를 사용하여 이러한 변화가 없는 뉘런을 탐지하며, 스트래글러 데이터에 의존하지 않습니다.
- 클라이언트의 학습 시간과 업데이트 크기를 기반으로 하위 모델 크기를 결정하는 동적 드롭 임계값을 계산합니다.
- 프레임워크는 학습 중 주기적으로 하위 모델을 재보정하여 배터리 고갈이나 네트워크 변동과 같은 런타임 변화에 적응합니다.
- 임계값 이하의 뉘런을 제거하여 하위 모델을 구성함으로써, 스트래글러가 학습하는 데는 영향력이 높은 뉘런만 유지됩니다.
- 캘리브레이션 과정은 서버에서 중심화되어 엣지 기기의 오버헤드를 최소화하며 총 런타임 비용을 학습 시간의 5% 이내로 유지합니다.

실험 결과
연구 질문
- RQ1어떻게 동적으로 영향력이 낮은 뉘런을 식별하고 제거하여 연합 학습에서 스트래글러 기기의 계산 부담을 줄일 수 있을까요?
- RQ2뉘런 업데이트의 변화 없음 기반 하위 모델 정리 전략이 모델 정확도를 유지하면서 학습 효율성을 향상시킬 수 있을까요?
- RQ3변하는 스트래글러 조건에 대한 런타임 적응성이 이질적인 연합 학습 환경에서 학습 속도와 수렴에 어떤 영향을 미칠까요?
- RQ4정적 또는 무작위 하위 모델 정리 전략에 비해 Invariant Dropout은 정확도 및 성능 향상 측면에서 어떻게 비교될 수 있을까요?
- RQ5다양한 계산 능력을 지닌 클라이언트와 동적인 스트래글러 행동을 고려할 때, 프레임워크는 대규모 환경에서 확장 가능한가요?
주요 결과
- FLuID는 다양한 실제 모바일 클라이언트에서 기준 동기식 연합 학습 대비 최대 18% 빠른 학습 시간을 달성했습니다.
- 스트래글러 성능이 학습 도중 변동하더라도, 정적 스트래글러 집합을 사용한 경우 대비 14~18%의 학습 시간 단축을 기록했습니다.
- Invariant Dropout은 Ordered 및 Random Dropout보다 우수했으며, 벤치마크 데이터셋에서 최대 1.4%p의 정확도 향상을 달성했습니다.
- FLuID의 캘리브레이션 오버헤드는 총 학습 시간의 5% 미만이었으며, 경량성임을 입증했습니다.
- 20%의 클라이언트가 스트래글러일 경우에도 FLuID는 정확도를 높게 유지했으며, 스트래글러를 완전히 제거하는 방법보다 뛰어난 성능을 보였습니다.
- 클라이언트 샘플링을 사용해 1000명의 시뮬레이션 클라이언트에서 효과적으로 확장되었으며, 대규모 동적 환경에서도 뛰어난 안정성을 보였습니다.

더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.