[논문 리뷰] FedZKT: Zero-Shot Knowledge Transfer towards Heterogeneous On-Device Models in Federated Learning.
FedZKT는 비균일한 데이터 분포와 느린 클라이언트 문제 상황에서도 성능을 유지하면서 기기 내 비균일한 모델 간 지식 전달을 가능하게 하는 연합 학습 프레임워크를 제안한다. 서버는 다양한 클라이언트 모델에 대응하는 생성자 모델을 훈련시켜 자원을 집중적으로 소비하는 지식 정규화를 수행함으로써 기기의 부담을 크게 줄인다.
Federated learning enables distributed devices to collaboratively learn a shared prediction model without centralizing on-device training data. Most of the current algorithms require comparable individual efforts to train on-device models with the same structure and size, impeding participation from resource-constrained devices. Given the widespread yet heterogeneous devices nowadays, this paper proposes a new framework supporting federated learning across heterogeneous on-device models via Zero-shot Knowledge Transfer, named by FedZKT. Specifically, FedZKT allows participating devices to independently determine their on-device models. To transfer knowledge across on-device models, FedZKT develops a zero-shot distillation approach contrary to certain prior research based on a public dataset or a pre-trained data generator. To utmostly reduce on-device workload, the resource-intensive distillation task is assigned to the server, which constructs a generator to adversarially train with the ensemble of the received heterogeneous on-device models. The distilled central knowledge will then be sent back in the form of the corresponding on-device model parameters, which can be easily absorbed at the device side. Experimental studies demonstrate the effectiveness and the robustness of FedZKT towards heterogeneous on-device models and challenging federated learning scenarios, such as non-iid data distribution and straggler effects.
연구 동기 및 목표
- 기기 자원과 모델 아키텍처의 다양성으로 인해 연합 학습에서 비균일한 기기 내 모델을 훈련하는 데 도전하는 문제를 해결한다.
- 일치하는 훈련 데이터나 공통된 모델 아키텍처가 없이도 크기와 구조가 다른 모델 간에 효과적인 지식 전달을 가능하게 한다.
- 복잡한 지식 정규화 과정을 서버로 이관함으로써 기기 내 계산 부담을 줄인다.
- 실제 구현 환경에서 비균일한 데이터 분포와 느린 클라이언트 영향을 고려한 강건한 연합 학습을 지원한다.
제안 방법
- 각 기기가 로컬 데이터와 자원 제약 조건에 따라 독립적으로 자신의 기기 내 모델을 선택하고 훈련시킨다.
- 공통된 사전 훈련된 모델이나 데이터 생성기 없이도 지식을 전달할 수 있는 제로샷 정규화 방법을 개발한다.
- 정규화 작업을 서버에 할당하여, 비균일한 클라이언트 모델의 앙상블에 대해 적대적으로 대응하는 생성자를 훈련시킨다.
- 서버의 생성자와 집계된 클라이언트 모델 간의 적대적 훈련을 통해 중심 지식을 구성한 후, 이를 다시 모델 파라미터로 정규화한다.
- 서버에서 제공한 지식을 직접 사용하여 기기 측에서 로컬 모델 파라미터를 갱신함으로써 지식 적응을 가능하게 한다.
- 지식 정규화의 복잡성을 서버의 계산 능력으로 이관함으로써 기기 내 계산을 최소화한다.
실험 결과
연구 질문
- RQ1모델 아키텍처나 데이터가 일치하지 않아도 연합 학습에서 비균일한 기기 내 모델 간에 효과적인 지식 전달이 가능한가?
- RQ2자원이 제한된 기기에서 연합 학습의 지식 정규화 과정에 소요되는 계산 비용을 어떻게 최소화할 수 있는가?
- RQ3비균일한 데이터 분포와 느린 클라이언트 영향 상황에서 FedZKT는 모델 성능을 어느 정도 유지하는가?
- RQ4서버 측 생성자를 활용한 적대적 훈련 기반 제로샷 정규화 메커니즘이 다양한 모델 간에 강건한 지식 전달을 달성할 수 있는가?
주요 결과
- FedZKT는 모델이나 데이터 일치 없이도 크기와 아키텍처가 다른 기기 내 모델 간에 효과적인 지식 전달을 가능하게 한다.
- 서버 기반의 정규화 메커니즘은 기기 내 계산 부담을 크게 줄여 자원이 제한된 기기에서도 연합 학습을 구현 가능하게 한다.
- FedZKT는 비균일한 데이터 분포 조건에서도 뛰어난 성능을 보이며, 데이터가 왜곡된 클라이언트 상황에서도 높은 정확도를 유지한다.
- 프레임워크는 느린 또는 신뢰할 수 없는 클라이언트 영향에 강건하여 전체 모델 성능이 저하되지 않는다.
- 실험 결과 FedZKT는 기준 방법과 경쟁 가능한 정확도를 달성하면서도 기기 측 계산을 최소화함을 확인했다.
- 제로샷 정규화 방법은 공개 데이터셋이나 사전 훈련된 데이터 생성기가 필요 없어 프라이버시와 확장성 측면에서 향상된다.
더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.