Skip to main content
QUICK REVIEW

[논문 리뷰] Efficient Split-Mix Federated Learning for On-Demand and In-Situ Customization

Junyuan Hong, Haotao Wang|arXiv (Cornell University)|2022. 03. 18.
Privacy-Preserving Technologies in Data인용 수 6
한 줄 요약

이 논문은 이종적인 피어드 학습 환경에서 모델 크기와 내성 강도를 실시간으로 및 현장에서 맞춤설정할 수 있도록 하는 새로운 프레임워크인 Split-Mix 피어드 학습을 제안한다. 다양한 너비와 내성 강도 수준을 가진 여러 기본 하위망을 별도로 훈련하고 집계함으로써, 추론 시점에서 동적으로 모델을 조합할 수 있도록 하여, 기존 방법에 비해 통신, 저장, 추론 측면에서 뛰어난 효율성을 달성하며, 자원 제약 조건에서도 정확도 저하가 최소화된다.

ABSTRACT

Federated learning (FL) provides a distributed learning framework for multiple participants to collaborate learning without sharing raw data. In many practical FL scenarios, participants have heterogeneous resources due to disparities in hardware and inference dynamics that require quickly loading models of different sizes and levels of robustness. The heterogeneity and dynamics together impose significant challenges to existing FL approaches and thus greatly limit FL's applicability. In this paper, we propose a novel Split-Mix FL strategy for heterogeneous participants that, once training is done, provides in-situ customization of model sizes and robustness. Specifically, we achieve customization by learning a set of base sub-networks of different sizes and robustness levels, which are later aggregated on-demand according to inference requirements. This split-mix strategy achieves customization with high efficiency in communication, storage, and inference. Extensive experiments demonstrate that our method provides better in-situ customization than the existing heterogeneous-architecture FL methods. Codes and pre-trained models are available: https://github.com/illidanlab/SplitMix.

연구 동기 및 목표

  • 기기 이종성과 환경 변화로 인한 피어드 학습에서 실시간 자원 및 내성 강도 요구사항의 동적 변화 문제를 해결하기 위해.
  • 재훈련 비용, 저장 비용, 추론 비용을 크게 들이지 않고도 현장에서 실시간으로 모델 크기와 적대적 내성 강도를 맞춤설정할 수 있도록 하기 위해.
  • 기존의 이종 아키텍처 피어드 학습 방법의 한계를 극복하기 위해, 예를 들어 대규모 모델에서의 부족한 훈련 및 비IIDs 데이터 하에서의 낮은 일반화 성능 문제를 해결하기 위해.
  • 다양한 하드웨어 및 예산 제약 조건을 가진 다양한 클라이언트 간에 효율적인 지식 전이 및 모델 조합을 가능하게 하는 확장 가능한 모듈식 프레임워크를 개발하기 위해.

제안 방법

  • 전체 너비의 모델을 다양한 너비(예: ×0.25, ×0.5)와 내성 강도 수준을 가진 여러 기본 하위망으로 분할하고, 각 클라이언트에서 별도로 훈련한다.
  • 각 기본 모델은 로컬 데이터에서 완전히 훈련되며, 이는 전체 지식 활용을 보장하고 대규모 모델에서 흔히 발생하는 부족한 훈련 문제를 완화한다.
  • 추론 시점에서 선택된 기본 모델들을 가중치 집계 방식으로 혼합함으로써 맞춤형 모델을 구성하며, 기기 제약 조건에 따라 동적으로 적응할 수 있다.
  • 일련의 새로운 미분 가능 아키텍처 탐색(DBN 기반) 방법을 도입하여 훈련 중에 내성 강도와 너비를 동시에 최적화함으로써 일반화 성능을 향상시킨다.
  • 클라이언트는 샘플링 전략(알고리즘 2)을 사용하여 모든 기본 모델이 모든 기기에서 훈련되도록 보장함으로써 지식 다양성과 모델 안정성을 향상시킨다.
  • 프레임워크는 너비와 내성 강도 양쪽의 맞춤설정을 동시에 지원하며, 단일 조건 변수를 통해 트레이드오프를 부드럽게 조정할 수 있다.

실험 결과

연구 질문

  • RQ1재훈련 없이도 피어드 학습 프레임워크가 자원 제약 조건 하에서 실시간으로 및 현장에서 모델 크기와 내성 강도를 맞춤설정할 수 있는가?
  • RQ2자원 예산이 상이한 이종 클라이언트 간에 지식을 효율적으로 공유하고 집계할 수 있는가?
  • RQ3독립적으로 훈련된 기본 하위망이 자원 제약 조건 하에서 공동으로 훈련된 대규모 모델보다 더 우수한 일반화 성능과 더 낮은 정확도 손실을 달성할 수 있는가?
  • RQ4기존의 이종 아키텍처 피어드 학습 방법에 비해 제안된 Split-Mix 전략은 정확도, 통신, 추론 효율성 측면에서 어떻게 비교되는가?
  • RQ5모델 너비와 적대적 내성 강도를 동적으로 조정할 때, 이 방법이 얼마나 높은 수준의 내성 강도와 정확도를 유지할 수 있는가?

주요 결과

  • Split-Mix는 HeteroFL 및 FedAvg에 비해 현저히 뛰어난 현장 맞춤설정 성능을 보이며, 자원 제약 조건 하에서도 정확도 저하가 적다.
  • 비IIDs 데이터 설정에서 Split-Mix는 HeteroFL 대비 정확도 손실을 최대 3.5% 감소시켰으며, 특히 클립아트 및 페인팅과 같은 도메인에서 모델의 부족한 훈련 문제가 심각한 경우에 두드러진다.
  • Split-Mix는 모든 기본 모델이 클라이언트 전역에서 완전히 훈련되어 각 도메인에서 100%의 파라미터 활용률을 달성하는 반면, HeteroFL는 최대 60%의 파라미터가 부족하게 훈련되는 것을 방지하지 못한다.
  • 제안된 Split-Mix+DAT 확장은 FedAvg+OAT에 비해 더 부드러운 내성 강도-표준 정확도 트레이드오프를 달성하며, 수렴 문제 없이 FedAvg+AT 기준보다 뛰어난 성능을 보였다.
  • 가변 너비 시나리오에서 Split-Mix+DAT는 너비가 증가함에 따라 내성 및 표준 정확도 모두 향상되며, 효과적이고 안정적인 동시 맞춤설정을 보여준다.
  • 프레임워크는 여러 개의 전체 모델을 저장하거나 재훈련할 필요가 없기 때문에 통신 및 저장 비용을 줄이며, 효율적인 현장 모델 전환을 가능하게 한다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.