[논문 리뷰] Rethinking Client Drift in Federated Learning: A Logit Perspective
이 논문은 클라이언트 드리프트를 줄이기 위해 국소 모델과 글로벌 모델의 로짓을 클래스 프로토타입 유사도 정규화를 통해 정렬하는 새로운 피어드 학습 프레임워크인 FedCSD를 제안한다. 동적 마스크를 통해 신뢰할 수 없는 글로벌 소프트 레이블을 적응적으로 필터링함으로써, Catastrophic forgetting을 감소시키고 비IIDs 데이터 환경에서 성능을 향상시킨다. CIFAR-100과 FEMNIST에서 최신 기술들을 초월하며 최대 71.53%의 정확도를 기록한다.
Federated Learning (FL) enables multiple clients to collaboratively learn in a distributed way, allowing for privacy protection. However, the real-world non-IID data will lead to client drift which degrades the performance of FL. Interestingly, we find that the difference in logits between the local and global models increases as the model is continuously updated, thus seriously deteriorating FL performance. This is mainly due to catastrophic forgetting caused by data heterogeneity between clients. To alleviate this problem, we propose a new algorithm, named FedCSD, a Class prototype Similarity Distillation in a federated framework to align the local and global models. FedCSD does not simply transfer global knowledge to local clients, as an undertrained global model cannot provide reliable knowledge, i.e., class similarity information, and its wrong soft labels will mislead the optimization of local models. Concretely, FedCSD introduces a class prototype similarity distillation to align the local logits with the refined global logits that are weighted by the similarity between local logits and the global prototype. To enhance the quality of global logits, FedCSD adopts an adaptive mask to filter out the terrible soft labels of the global models, thereby preventing them to mislead local optimization. Extensive experiments demonstrate the superiority of our method over the state-of-the-art federated learning approaches in various heterogeneous settings. The source code will be released.
연구 동기 및 목표
- 데이터 이질성과 비IIDs 데이터 분포로 인한 피어드 학습에서의 클라이언트 드리프트를 해결하기 위해.
- 국소 모델과 글로벌 모델 간의 로짓 차이가 성능 저하에 기여하는 정도를 조사하기 위해.
- 클래스 프로토타입 유사도를 이용해 국소 로짓을 정련된 글로벌 로짓과 정렬함으로써 모델 일반화를 향상시키기 위해.
- 지식 정규화 과정에서 저품질의 글로벌 소프트 레이블이 잘못된 지시를 줄 수 있는 문제를 방지하기 위해.
- 로컬 데이터에 적응하면서도 글로벌 지식를 유지하는 통신 효율적인 방법을 개발하기 위해.
제안 방법
- FedCSD는 글로벌 클래스 프로토타입과의 유사도에 따라 가중치가 부여된 글로벌 로짓과 국소 로짓을 유사도 기반으로 정렬하는 클래스 프로토타입 유사도 정규화 메커니즘을 도입한다.
- 신뢰할 수 없는 글로벌 소프트 레이블을 선택적으로 필터링하기 위해 적응형 마스크를 활용하며, 초기 학습 단계에서 유용하지만 잘못된 예측을 유지하는 데 유리하다.
- 적응형 마스크는 글로벌 모델 정확도에 따라 필터링 비율을 동적으로 조정하여 성능 향상에 따라 과도한 필터링을 줄인다.
- 국소 로짓과 글로벌 프로토타입 간의 유사도를 기반으로 가중 평균을 사용해 글로벌 로짓을 정련함으로써 지식 전이의 품질을 향상시킨다.
- 국소 손실 함수는 교차 엔트로피와 정련된 글로벌 로짓에서의 산란을 방지하는 정규화 손실을 조합한다.
- 글로벌 모델의 프로토타입 행렬은 라운드당 한 번만 전송되며, 통신 비용은 극히 적게 들며 (O(|Y|²)) 스케일링에 유리하다.
실험 결과
연구 질문
- RQ1비IIDs 데이터 하에서 피어드 학습 중 국소 모델과 글로벌 모델 간의 로짓 차이가 어떻게 변화하는가?
- RQ2로짓 이동이 피어드 학습에서 성능 저하에 기여하는 정도는 어느 정도인가?
- RQ3국소 로짓과 글로벌 로짓을 정렬하는 것이 특징 분포 이동을 효과적으로 줄이고 일반화를 향상시키는가?
- RQ4글로벌 소프트 레이블의 품질이 피어드 학습에서 지식 정규화에 미치는 영향은 무엇이며, 어떻게 향상시킬 수 있는가?
- RQ5일부 잘못된 소프트 레이블을 유지하는 적응형 마스크는 엄격한 필터보다 일반화 성능을 향상시키는가?
주요 결과
- FedCSD는 β=5인 레이블 스케일 조건에서 CIFAR-100에서 71.53%의 테스트 정확도를 기록하며, FedAvg 및 기타 최신 기술들을 능가한다.
- 적응형 마스크는 모든 잘못된 소프트 레이블을 제거하는 강력한 마스크보다 성능 향상이 뚜렷하며, 글로벌 모델 정확도가 높아질수록 더욱 두드러진다.
- FEMNIST에서 FedCSD는 특징 분포 이동을 크게 줄이며, 특징 공간에서 더 나은 클래스 클러스터링과 결정 경계를 확보한다.
- 특히 레이블 스케일 설정에서 FedAvg에 비해 빠른 수렴과 더 안정적인 학습 곡선을 보였다.
- 시각화 결과는 FedCSD가 국소 모델에 글로벌 지식을 유지시켜 국소 데이터 편향에 의한 과적합을 방지함을 확인했다.
- 통신 비용은 극히 적게 들며, 라운드당 오직 |Y|×|Y| 크기의 프로토타입 행렬만 전송되기 때문에 확장성이 뛰어나다.
더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.