Skip to main content
QUICK REVIEW

[논문 리뷰] RSCFed: Random Sampling Consensus Federated Semi-supervised Learning

Xiaoxiao Liang, Yiqun Lin|arXiv (Cornell University)|2022. 03. 26.
Privacy-Preserving Technologies in Data인용 수 9
한 줄 요약

RSCFed는 비동일분포(Non-IID) 환경에서 다수의 하위합의 모델을 도출하기 위해 클라이언트에 대한 랜덤 부분 샘플링을 수행하고, 이를 바탕으로 거리에 기반한 재가중 평균화 기반의 앙상블 기법을 적용하는 새로운 피어드 세미지도 학습 프레임워크를 제안한다. 이는 기존 최고 성능(SOTA) 방법들보다 최대 3.98% 높은 정확도와 3.5% 높은 AUC 성능을 보이며, 특히 레이블이 없는 클라이언트 비율이 높은 환경에서 뛰어난 성능을 발휘한다.

ABSTRACT

Federated semi-supervised learning (FSSL) aims to derive a global model by training fully-labeled and fully-unlabeled clients or training partially labeled clients. The existing approaches work well when local clients have independent and identically distributed (IID) data but fail to generalize to a more practical FSSL setting, i.e., Non-IID setting. In this paper, we present a Random Sampling Consensus Federated learning, namely RSCFed, by considering the uneven reliability among models from fully-labeled clients, fully-unlabeled clients or partially labeled clients. Our key motivation is that given models with large deviations from either labeled clients or unlabeled clients, the consensus could be reached by performing random sub-sampling over clients. To achieve it, instead of directly aggregating local models, we first distill several sub-consensus models by random sub-sampling over clients and then aggregating the sub-consensus models to the global model. To enhance the robustness of sub-consensus models, we also develop a novel distance-reweighted model aggregation method. Experimental results show that our method outperforms state-of-the-art methods on three benchmarked datasets, including both natural and medical images. The code is available at https://github.com/XMed-Lab/RSCFed.

연구 동기 및 목표

  • 비동일분포(Non-IID) 데이터 환경에서 레이블이 있는 클라이언트와 없는 클라이언트 간의 모델 신뢰도 불균형으로 인해 기존 피어드 세미지도 학습(FSSL) 방법의 일반화 성능이 떨어지는 문제를 해결하기 위해.
  • 공유된 상관행렬이나 동일한 가중치 기반 평균화에 의존하는 것에서 벗어나, 이는 이질적인 데이터 환경에서 정보 泄露 또는 모델 품질 저하의 위험을 초래할 수 있음을 고려하여.
  • 하위합의 모델과의 거리에 기반해 동적으로 가중치를 할당하는 강력한 평균화 메커니즘을 개발하여 글로벌 모델의 안정성을 향상시키기 위해.
  • 레이블이 있는/없는 클라이언트 비율과 통신 비용 제약 조건이 다양한 상황에서의 성능 평가를 통해 실용적인 구현 가능성을 확보하기 위해.

제안 방법

  • RSCFed는 매 플러딩 학습(FL) 동기화 라운드마다 로컬 클라이언트들에 대해 다수의 랜덤 부분 샘플링을 수행하여 서로 다른 하위합의 모델을 생성한다.
  • 각 하위합의 모델는 무작위로 선택된 로컬 모델의 가중치 평균을 통해 형성되며, 이는 일부 클라이언트 집합으로부터의 합의를 시뮬레이션한다.
  • 거리 재가중 평균화 모듈(DMA)은 현재 하위합의 모델에 가까운 로컬 모델일수록 더 높은 가중치를 할당하여 모델의 강건성 향상을 도모한다.
  • 최종 글로벌 모델은 DMA 기반 가중치를 적용해 모든 하위합의 모델을 앙상블하여 업데이트하며, 이로써 신뢰도가 낮거나 이방성(아웃라이어)일 가능성이 있는 모델의 영향을 줄인다.
  • 이 방법은 클라이언트 간에 민감한 정보를 공유하지 않아 개인정보 보호를 보장하고 정보 泄露를 방지한다.
  • M(하위샘플링 수)와 K(하나의 하위샘플에 포함되는 클라이언트 수)와 같은 하이퍼파라미터는 경험적으로 최적화되었으며, M=3과 K=5에서 최고의 성능를 기록했다.

실험 결과

연구 질문

  • RQ1클라이언트에 대한 랜덤 부분 샘플링이 비동일분포 피어드 세미지도 학습 환경에서 모델 합의 및 강건성 향상에 기여하는가?
  • RQ2거리 기반 재가중 평균화 방식이 균일하거나 히وري스틱 가중치 방식보다 하위합의 모델 품질을 어떻게 향상시키는가?
  • RQ3기존 방법들이 성능 저하를 보이는 고도의 레이블 없는 클라이언트 비율 환경에서도 RSCFed는 뛰어난 성능 유지를 할 수 있는가?
  • RQ4하위샘플링 연산으로 인해 통신 비용이 어떻게 증가하는가? 그리고 감소된 통신 예산 조건에서도 RSCFed는 베이스라인 성능을 초월할 수 있는가?

주요 결과

  • 15명의 클라이언트를 가진 ISIC 2018 데이터셋에서 RSCFed는 70.26%의 테스트 정확도와 95.5%의 AUC 성능을 기록했으며, 고도의 레이블 없는 클라이언트 비율 조건에서 Fed-Consist [28]보다 정확도 3.98%p, AUC 3.5%p 높은 성능를 기록했다.
  • 10명의 클라이언트(2명 레이블, 8명 레이블 없음) 조건에서 RSCFed는 FedIRM [21]보다 정확도 1.13%p, AUC 0.3%p, 정밀도 0.86%p, 재현율 2.86%p 향상된 성능를 기록했다.
  • Fed-Consist [28]의 0.8배 통신 비용 조건에서도 RSCFed는 더 높은 정확도와 AUC 성능를 기록하여, 저대역폭 환경에서도 효율성과 강건성을 입증했다.
  • 제거 실험 결과, M 및 K 값의 변화에 따른 성능 저하가 최소한이었으며, 이는 RSCFed가 하이퍼파라미터 설정에 대해 매우 안정적이고 민감하지 않음을 시사한다.
  • 거리 기반 재가중 평균화 메커니즘은 모든 데이터셋과 설정에서 일관된 성능 향상을 보이며, 하위합의 모델 품질 향상에 기여한다는 것이 입증되었다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.