[논문 리뷰] Client Selection in Federated Learning: Principles, Challenges, and Opportunities
이 논문은 연합 학습(FL)에서 클라이언트 선택에 대한 종합적인 조사를 제공하며, 시스템 이질성과 데이터 이질성을 원칙에 입각한 알고리즘을 통해 모델 정확도, 수렴 속도 및 공정성 향상에 기여한다. 최근의 발전을 통합하고 핵심 과제를 규명하며, 실제 FL 구현에서 클라이언트 선택을 최적화하기 위한 연구 기회를 제시한다.
As a privacy-preserving paradigm for training Machine Learning (ML) models, Federated Learning (FL) has received tremendous attention from both industry and academia. In a typical FL scenario, clients exhibit significant heterogeneity in terms of data distribution and hardware configurations. Thus, randomly sampling clients in each training round may not fully exploit the local updates from heterogeneous clients, resulting in lower model accuracy, slower convergence rate, degraded fairness, etc. To tackle the FL client heterogeneity problem, various client selection algorithms have been developed, showing promising performance improvement. In this paper, we systematically present recent advances in the emerging field of FL client selection and its challenges and research opportunities. We hope to facilitate practitioners in choosing the most suitable client selection mechanisms for their applications, as well as inspire researchers and newcomers to better understand this exciting research topic.
연구 동기 및 목표
- 클라이언트 간 데이터 분포와 시스템 능력의 이질성이 발생하는 연합 학습에서의 핵심 과제인 클라이언트 이질성 문제를 해결한다.
- 기존 클라이언트 선택 알고리즘을 체계적으로 검토하여 설계 원칙, 성능 트레이드오프 및 한계를 규명한다.
- 현재 클라이언트 선택 방법에서 이론적 보장과 표준화된 벤치마크의 부족함을 강조한다.
- 특히 대규모 및 동적 FL 환경에서 공정성, 내성 및 확장성 측면에서의 연구 격차를 규명한다.
- 재현 가능한 FL 연구를 위해 표준화된 평가 지표 및 대규모 개방형 테스트베드의 개발을 촉진한다.
제안 방법
- 계산 능력, 대역폭 등의 시스템 이질성과 비IIDs 데이터 등의 데이터 이질성 처리 방식에 따라 클라이언트 선택 알고리즘을 분류한다.
- 2019–2023년 기간 동안의 14개의 대표적 논문을 분석하여 클라이언트 참가를 위한 명시적 유틸리티 함수와 스케줄링 결정에 중점을 둔다.
- 모델 기여도, 업데이트 품질, 자원 제약 조건을 고려한 유틸리티 함수를 기반으로 클라이언트 선택을 평가하는 프레임워크를 제안한다.
- 그리디, 밴디트 기반, 강화 학습, 유틸리티 최적화 접근 방식으로 클라이언트 선택 전략을 분류한다.
- Oort와 POWER-OF-CHOICE와 같은 방법에서 관찰된 바와 같이, 데이터 이질성과 시스템 이질성을 동시에 고려하는 것이 중요하다는 점을 강조한다.
- 클라이언트 가용성, 업데이트 연령, 통신 효율성 등을 고려한 적응형 및 동적 선택 메커니즘의 필요성을 주장한다.

실험 결과
연구 질문
- RQ1FL 클라이언트의 시스템 이질성과 데이터 이질성이 모델 수렴, 정확도 및 공정성에 어떤 영향을 미치는가?
- RQ2기존 클라이언트 선택 알고리즘에서의 핵심 설계 원칙과 성능 트레이드오프는 무엇인가?
- RQ3다수의 클라이언트 선택 방법이 이론적 보장이 없는 이유는 무엇이며, 이는 실제 구현에 어떤 영향을 미치는가?
- RQ4평가 방법의 주요 한계, 즉 지표와 실험 설정 측면에서의 문제점은 무엇인가?
- RQ5대규모 개방형 테스트베드와 표준화된 벤치마크는 클라이언트 선택 연구의 재현 가능성과 공정성 향상에 어떻게 기여할 수 있는가?
주요 결과
- 클라이언트 선택은 데이터 이질성과 시스템 이질성의 악영향을 완화시켜 FL 성능을 크게 향상시킨다.
- Oort와 POWER-OF-CHOICE와 같은 알고리즘은 데이터 및 시스템 이질성을 동시에 모델링함으로써 더 빠른 수렴을 달성한다.
- 다수의 클라이언트 선택 방법은 히우리스틱이며, 수렴 속도, 정확도 또는 공정성에 대한 이론적 보장이 부족하다.
- 최적의 클라이언트 선택 기준에 대한 합의가 없으며, 일부 연구는 모델이 다를수록 유리하다고 보는 반면, 다른 연구는 유사한 모델을 선호한다. 이는 맥락에 따라 달라진다.
- 통신 부하와 라운드 지속 시간 간의 충돌적 트레이드오프로 인해, 라운드-정확도 및 시간-정확도와 같은 기존 평가 지표는 상호 비교가 어렵다.
- 재현 가능하고 공정한 클라이언트 선택 알고리즘 평가를 위해 커뮤니티는 대규모 개방형 FL 테스트베드의 도입이 급박히 필요하다.
더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.