Skip to main content
QUICK REVIEW

[논문 리뷰] RC-SSFL: Towards Robust and Communication-efficient Semi-supervised Federated Learning System.

Yi Liu, Xingliang Yuan|arXiv (Cornell University)|2020. 12. 08.
Privacy-Preserving Technologies in Data참고 문헌 53인용 수 14
한 줄 요약

RC-SSFL는 라벨이 부족한 클라이언트 데이터와 제한된 라벨이 있는 서버 데이터만을 사용하여 높은 품질의 글로벌 모델을 훈련시키는 강건하고 통신 효율적인 준지도 학습 분산 학습 시스템을 제안한다. 이 시스템은 최소화 최대 최적화 기반 클라이언트 선택 및 기하 평균 집계를 통해 오염 공격에 대응하며, 통신 오버헤드를 2배에서 4배 감소시켜 표준 FL 수준의 성능을 달성한다.

ABSTRACT

Federated Learning (FL) is an emerging decentralized artificial intelligence paradigm, which promises to train a shared global model in high-quality while protecting user data privacy. However, the current systems rely heavily on a strong assumption: all clients have a wealth of ground truth labeled data, which may not be always feasible in the real life. In this paper, we present a practical Robust, and Communication-efficient Semi-supervised FL (RC-SSFL) system design that can enable the clients to jointly learn a high-quality model that is comparable to typical FL's performance. In this setting, we assume that the client has only unlabeled data and the server has a limited amount of labeled data. Besides, we consider malicious clients can launch poisoning attacks to harm the performance of the global model. To solve this issue, RC-SSFL employs a minimax optimization-based client selection strategy to select the clients who hold high-quality updates and uses geometric median aggregation to robustly aggregate model updates. Furthermore, RC-SSFL implements a novel symmetric quantization method to greatly improve communication efficiency. Extensive case studies on two real-world datasets demonstrate that RC-SSFL can maintain the performance comparable to typical FL in the presence of poisoning attacks and reduce communication overhead by $2 imes \sim 4 imes $.

연구 동기 및 목표

  • 표준 FL이 클라이언트 측에서 풍부한 라벨 데이터가 필요로 하는 실용적 제약를 해결하기 위해, 라벨이 없는 클라이언트 데이터와 제한된 라벨이 있는 서버 데이터만으로 학습이 가능하도록 하는 것.
  • 모델 집계 과정에서 악성 클라이언트가 오염 공격을 시도할 경우에도 시스템의 강건성을 향상시키는 것.
  • 모델 성능을 희생시키지 않은 채로 분산 학습의 통신 비용을 줄이는 것.
  • 현실적인 데이터 및 위협 환경 조건에서도 높은 모델 정확도를 유지할 수 있는 시스템 설계

제안 방법

  • 고품질 모델 업데이트 기여 클라이언트를 식별하기 위해 최소화 최대 최적화 기반의 클라이언트 선택 전략을 적용한다.
  • 오염 공격에 강건하게 모델 업데이트를 통합하기 위해 기하 평균 집계를 사용한다.
  • 모델 업데이트를 압축하고 통신 오버헤드를 줄이기 위해 새로운 대칭 양자화 방법을 도입한다.
  • 준지도 학습 원리를 활용하여 클라이언트 측의 라벨이 없는 데이터와 서버 측의 소량의 라벨 데이터로 훈련한다.
  • 클라이언트 선택, 강건한 집계, 통신 효율적인 양자화를 통합한 유일한 프레임워크로 시스템 아키텍처를 설계한다.
  • 클라이언트가 로컬로 훈련하고 오직 모델 업데이트만 서버와 교환하는 탈중앙화된 FL 환경에서 운영된다.

실험 결과

연구 질문

  • RQ1클라이언트가 라벨이 없는 데이터만 가지고 있고 서버가 제한된 라벨 샘플을 가진 경우, 분산 학습 시스템이 표준 FL 수준의 성능을 달성할 수 있는가?
  • RQ2준지도 학습 환경에서 악성 클라이언트가 오염 공격을 시도할 경우, 분산 학습 시스템은 어떻게 강건성을 확보할 수 있는가?
  • RQ3모델 정확도를 저하시키지 않은 채로 준지도 학습 분산 학습에서 통신 효율성을 얼마나 향상시킬 수 있는가?
  • RQ4낮은 라벨 데이터 환경에서 강건성과 성능을 균형 잡는 데 가장 효과적인 클라이언트 선택 및 집계 전략은 무엇인가?

주요 결과

  • 클라이언트가 라벨 데이터를 전혀 가지지 않거나 서버가 라벨 샘플을 소량만 가진 상태에서도 RC-SSFL는 표준 FL과 유사한 모델 성능을 유지한다.
  • 최소화 최대 기반 클라이언트 선택 및 기하 평균 집계를 통해 오염 공격에 효과적으로 대응하여 글로벌 모델의 무결성을 유지한다.
  • 제안된 대칭 양자화 방법을 통해 통신 오버헤드가 2배에서 4배 감소한다.
  • 두 개의 실세계 데이터셋에서 실시한 광범위한 실험을 통해 RC-SSFL가 악성 환경과 데이터 부족 조건에서도 강건성과 효율성을 입증한다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.