Skip to main content
QUICK REVIEW

[논문 리뷰] FedCom: A Byzantine-Robust Local Model Aggregation Rule Using Data Commitment for Federated Learning

Bo Zhao, Peng Sun|arXiv (Cornell University)|2021. 04. 16.
Privacy-Preserving Technologies in Data참고 문헌 32인용 수 6
한 줄 요약

FedCom는 비잔틴성에 강한 페더레이티드 러닝 프레임워크를 제안하며, 비독립 동일 분포(Non-IID) 데이터 분포 하에서 데이터 풀링 공격과 모델 풀링 공격을 방어하기 위해 암호학적 데이터 커밋먼트를 사용한다. 데이터 커밋먼트 간의 워싱슈타인 거리 비교 및 커밋된 데이터에서의 국소 모델 행동 평가를 통해, 공개 검증 데이터셋이 필요 없이도 최신 기술 대비 뛰어난 강건성을 확보한다.

ABSTRACT

Federated learning (FL) is a promising privacy-preserving distributed machine learning methodology that allows multiple clients (i.e., workers) to collaboratively train statistical models without disclosing private training data. Due to the characteristics of data remaining localized and the uninspected on-device training process, there may exist Byzantine workers launching data poisoning and model poisoning attacks, which would seriously deteriorate model performance or prevent the model from convergence. Most of the existing Byzantine-robust FL schemes are either ineffective against several advanced poisoning attacks or need to centralize a public validation dataset, which is intractable in FL. Moreover, to the best of our knowledge, none of the existing Byzantine-robust distributed learning methods could well exert its power in Non-Independent and Identically distributed (Non-IID) data among clients. To address these issues, we propose FedCom, a novel Byzantine-robust federated learning framework by incorporating the idea of commitment from cryptography, which could achieve both data poisoning and model poisoning tolerant FL under practical Non-IID data partitions. Specifically, in FedCom, each client is first required to make a commitment to its local training data distribution. Then, we identify poisoned datasets by comparing the Wasserstein distance among commitments submitted by different clients. Furthermore, we distinguish abnormal local model updates from benign ones by testing each local model's behavior on its corresponding data commitment. We conduct an extensive performance evaluation of FedCom. The results demonstrate its effectiveness and superior performance compared to the state-of-the-art Byzantine-robust schemes in defending against typical data poisoning and model poisoning attacks under practical Non-IID data distributions.

연구 동기 및 목표

  • 통계적 이질점 탐지 기반의 공격을 회피하는 고도의 풀링 공격에 취약한 기존 비잔틴성에 강한 페더레이티드 러닝 기법의 취약점을 해결한다.
  • 기여 기반 집약 규칙에서 중심화된 공개 검증 데이터셋이 필수적인 현실성 없는 요구사항을 해소한다.
  • 클라이언트 데이터가 이질적이고 최소한의 겹침을 보이는 현실적인 비독립 동일 분포 조건 하에서 강건한 모델 집약을 가능하게 한다.
  • 개인 정보를暴露하지 않고도 데이터 무결성과 모델 행동을 검증할 수 있는 방어 메커니즘을 개발한다.
  • 암호학적 커밋먼트 원리를 사용해 단일 통합 프레임워크 내에서 데이터 풀링 및 모델 풀링 공격에 모두 내성을 확보한다.

제안 방법

  • 각 클라이언트는 로컬 훈련 데이터의 특징 클러스터 평균을 계산하여 데이터 커밋먼트를 생성함으로써, 기밀성을 유지하면서도 검증 가능한 데이터 분포 표현을 확보한다.
  • 공격당한 데이터셋은 클라이언트 간 데이터 커밋먼트 간 워싱슈타인 거리를 계산하여 탐지되며, 다수와 크게 다름을 보이는 이질점을 식별한다.
  • 국소 모델 업데이트는 해당 커밋먼트 데이터에서의 행동을 테스트함으로써 검증되며, 커밋된 데이터와의 일관성에 기반해 악성 업데이트와 양호한 업데이트를 구분한다.
  • 행동 인식 집약 규칙이 적용되며, 커밋된 데이터에서 일관되고 정확한 행동을 보이는 모델들만 글로벌 모델 집약에 포함된다.
  • 암호학적 커밋먼트 성질을 활용해 블라인드 검증을 가능하게 하여, 민감한 정보를暴露하지 않고도 데이터 및 모델 무결성을 확보한다.
  • 모든 클라이언트 중 (n−2)/2명 이하의 클라이언트만 비잔틴성일 것이라는 가정 하에 작동하며, 공모 및 시빌 공격에 대한 내성을 확보한다.

실험 결과

연구 질문

  • RQ1공개 검증 데이터셋이 없는 조건에서, 비잔틴성에 강한 페더레이티드 러닝 프레임워크가 데이터 풀링 및 모델 풀링 공격을 동시에 방어할 수 있는가?
  • RQ2비독립 동일 분포 데이터 분할 조건 하에서 제안된 데이터 커밋먼트 메커니즘이 공격당한 데이터 분포를 얼마나 효과적으로 탐지할 수 있는가?
  • RQ3비독립 동일 분포 환경에서 커밋된 데이터에서의 행동 평가가 악성 국소 모델 업데이트와 양호한 업데이트를 신뢰성 있게 구분할 수 있는가?
  • RQ4실제 비독립 동일 분포 데이터 조건 하에서 FedCom은 최신 기술 대비 비잔틴성에 강한 집약 규칙보다 얼마나 우수한 성능을 보이는가?
  • RQ5통계적으로 양호한 모델과 유사하게 보이게 설계된 고도의 공격에 대해 FedCom은 어느 정도 내성을 보이는가? 이는 전통적인 거리 기반 탐지 기법을 회피하기 위함이다.

주요 결과

  • 공격이 양호한 데이터 분포를 모방하도록 설계된 경우에도, FedCom은 데이터 커밋먼트 간 워싱슈타인 거리 비교를 통해 공격당한 데이터 분포를 성공적으로 탐지하고 배제한다.
  • 행동 인식 모델 집약 메커니즘이 커밋된 데이터에서 예상되는 행동과 다름을 보이는 악성 국소 모델 업데이트를 효과적으로 식별하고 거부한다.
  • FedCom은 비독립 동일 분포 조건 하에서 Krum, Bulyan, Trimmed Mean, Zeno와 같은 최신 기술 대비 데이터 및 모델 풀링 공격에 대한 방어에서 뛰어난 성능을 보인다.
  • 모든 클라이언트 중 (n−2)/2명 이하의 클라이언트가 비잔틴성일 경우에도 글로벌 모델 정확도와 수렴 속도를 높게 유지하며 강력한 강건성을 입증한다.
  • FedCom은 공개 검증 데이터셋이 필요 없음을 제거하여, 데이터 기밀성이 핵심인 실세계 페더레이티드 러닝 구현에 실용성을 확보한다.
  • 실험 결과는 FedCom이 전통적인 거리 기반 탐지 기법을 회피하기 위해 통계적 편차를 최소화하는 방식으로 설계된 고도의 공격에 대해서도 내성을 보임을 확인한다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.