[논문 리뷰] FedNoiL: A Simple Two-Level Sampling Method for Federated Learning with Noisy Labels
FedNoiL는 노이즈 있는 레이블 환경에서 피어드 학습(FedNoiL)을 위한 이중 수준 샘플링 방법을 제안한다. 서버는 글로벌 모델의 신뢰도를 기반으로 고품질의 클라이언트를 선택하고, 클라이언트는 의사 레이블링을 통해 청소된 레이블을 선택한다. 청소된 레이블 탐지와 준지도 학습을 통합함으로써, FedNoiL는 이질적인 노이즈와 비아이디어 데이터 분포 조건에서도 기존의 최고 성능(SOTA) FL 및 NLL 조합보다 일관되고 뛰어난 성능을 달성한다.
Federated learning (FL) aims at training a global model on the server side while the training data are collected and located at the local devices. Hence, the labels in practice are usually annotated by clients of varying expertise or criteria and thus contain different amounts of noises. Local training on noisy labels can easily result in overfitting to noisy labels, which is devastating to the global model through aggregation. Although recent robust FL methods take malicious clients into account, they have not addressed local noisy labels on each device and the impact to the global model. In this paper, we develop a simple two-level sampling method "FedNoiL" that (1) selects clients for more robust global aggregation on the server; and (2) selects clean labels and correct pseudo-labels at the client end for more robust local training. The sampling probabilities are built upon clean label detection by the global model. Moreover, we investigate different schedules changing the local epochs between aggregations over the course of FL, which notably improves the communication and computation efficiency in noisy label setting. In experiments with homogeneous/heterogeneous data distributions and noise ratios, we observed that direct combinations of SOTA FL methods with SOTA noisy-label learning methods can easily fail but our method consistently achieves better and robust performance.
연구 동기 및 목표
- 로컬 데이터에서 다양한 노이즈 비율로 인해 손상된 레이블을 가진 피어드 학습 환경에서의 이질적 레이블 노이즈 문제를 해결한다.
- 기존의 강건한 FL 방법들이 국소 레이블 노이즈를 간과하고 글로벌 집계와 국소 학습 간의 상호작용을 실패한다는 한계를 극복한다.
- 서버 및 클라이언트 수준에서 이중 수준 샘플링 전략을 도입함으로써, 노이즈 있는 레이블 조건 하에서의 강건성과 성능을 향상시킨다.
- 적응형 국소 에포크 스케줄링을 통해 통신 및 계산 효율성을 향상시킨다. 초기에는 더 많은 에포크를 수행하고 시간이 지남에 따라 감쇠 함수(예: 로그 또는余弦)를 통해 감소시킨다.
- 기계적 방식으로 SOTA FL 및 NLL 방법을 조합하는 것은 노이즈가 많고 비아이디어 설정에서 실패함을 입증하며, 이에 따라 FedNoiL와 같은 조율된 접근이 필수적임을 보여준다.
제안 방법
- 서버는 글로벌 모델의 신뢰도 점수를 사용해 클라이언트 수준의 샘플링을 수행하여, 노이즈 비율이 낮은 클라이언트를 우선순위로 선별해 글로벌 집계에 포함시킨다.
- 클라이언트는 글로벌 모델의 예측에서 높은 신뢰도를 가진 샘플을 선택하여 국소 학습을 위한 청소된 레이블로 활용한다.
- 준지도 학습 전략은 높은 신뢰도의 샘플을 레이블이 있는 것으로 간주하고, 나머지 샘플은 글로벌 모델의 의사 레이블을 사용해 레이블이 없는 것으로 간주한다.
- 클라이언트 및 데이터 선택에 대한 샘플링 확률은 글로벌 모델의 예측 신뢰도에서 유도되며, 이는 국소 모델보다 레이블 노이즈에 더 강건하다.
- 적응형 국소 에포크 스케줄링을 적용한다. 초기에는 더 많은 국소 에포크를 수행하고, 시간이 지남에 따라 감쇠 함수(예: 로그 또는余弦)를 통해 점차 감소시켜 수렴성과 통신 효율성을 균형 잡는다.
- 청결한 레이블 탐지와 의사 레이블링을 통합함으로써, 진짜 레이블에 접근할 필요 없이 국소 모델 품질을 향상시킨다.
실험 결과
연구 질문
- RQ1클라이언트 선택과 청소된 레이블 샘플링을 조합한 이중 수준 샘플링 전략이 노이즈 있는 레이블 조건에서 피어드 학습의 강건성 향상에 기여하는가?
- RQ2샘플링 확률 산정에 글로벌 모델의 신뢰도를 사용할 경우, 이질적 레이블 노이즈 조건에서의 성능에 어떤 영향을 미치는가?
- RQ3적응형 국소 에포크 스케줄링은 노이즈 있는 FL 환경에서 수렴성과 통신 효율성에 어떤 영향을 미치는가?
- RQ4신뢰도 기반 샘플링과 결합된 준지도 학습이 의사 레이블을 사용해 국소 모델 학습을 얼마나 향상시키는가?
- RQ5기계적 조합 방식으로 SOTA FL 및 NLL 방법이 비아이디어 및 고노이즈 FL 환경에서 실패하는 이유는 무엇이며, FedNoiL는 이를 어떻게 극복하는가?
주요 결과
- FedNoiL는 SOTA FL 및 NLL 방법의 직접 조합보다 유의미하게 뛰어난 성능을 보이며, 고노이즈 조건에서 CIFAR-10에서 최대 15%의 테스트 정확도 향상을 달성한다.
- 대칭 노이즈(50%) 조건에서 CIFAR-10에서 FedNoiL는 88.05%의 테스트 정확도를 기록했으며, 다음으로 좋은 방법보다 10个百分点 이상 뛰어나다.
- 제거 실험을 통해 클라이언트 수준과 데이터 수준의 샘플링이 모두 필수적임을 확인했다. 고노이즈 환경에서 균일 샘플링은 성능을 최대 20%까지 떨어뜨린다.
- 준지도 학습을 제거한 경우(FedNoiL†) 테스트 정확도가 10–15% 감소하고 레이블 정밀도/재현율도 저하되어, SSL의 핵심적 역할을 입증한다.
- 국소 에포크에 대한 로그 감쇠 스케줄링은 특히 노이즈가 많은 초기 학습 라운드에서 통신 효율성과 모델 수렴성을 향상시킨다.
- FedNoiL는 비아이디어 데이터 및 다양한 노이즈 비율 조건에서도 강건한 성능을 유지하며, 일반화 능력과 안정성을 입증한다.
더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.