[논문 리뷰] Data Poisoning Attacks Against Federated Learning Systems
논문은 연합학습에서 라벨 반전을 통한 표적 데이터 포이즈닝을 시연하고, 글로벌 정확도와 소스 클래스 재현율의 큰 하락을 보여주며, 악의적 업데이트를 식별하는 PCA 기반 방어를 도입합니다.
Federated learning (FL) is an emerging paradigm for distributed training of large-scale deep neural networks in which participants' data remains on their own devices with only model updates being shared with a central server. However, the distributed nature of FL gives rise to new threats caused by potentially malicious participants. In this paper, we study targeted data poisoning attacks against FL systems in which a malicious subset of the participants aim to poison the global model by sending model updates derived from mislabeled data. We first demonstrate that such data poisoning attacks can cause substantial drops in classification accuracy and recall, even with a small percentage of malicious participants. We additionally show that the attacks can be targeted, i.e., they have a large negative impact only on classes that are under attack. We also study attack longevity in early/late round training, the impact of malicious participant availability, and the relationships between the two. Finally, we propose a defense strategy that can help identify malicious participants in FL to circumvent poisoning attacks, and demonstrate its effectiveness.
연구 동기 및 목표
- 개인정보 보호를 위한 분산 학습의 연구 필요성과 악의적 참가자에 대한 취약성을 자극합니다.
- 연합학습에서 라벨 플리핑을 사용한 표적 데이터 포이즈닝 공격을 특성화합니다.
- 다양한 공격자 존재 여부, 시기, 가용성 하에서 공격 영향력을 평가합니다.
- 공격자를 식별하기 위한 방어 전략을 제안하고 FL에서의 악의적 참여자를 식별하는 방법을 실증적으로 검증합니다.
제안 방법
- 정직한 집계자와 로컬 데이터를 보유한 다수의 참가자가 있는 연합학습 구성을 형식화합니다.
- 공격자 참가자를 위한 오염 전략으로 라벨 플리핑(src -> target)을 사용합니다.
- 다양한 악의적 참가자 비율에서 CNN 아키텍처를 사용하여 CIFAR-10 및 Fashion-MNIST에 대한 영향을 평가합니다.
- 조기-오염과 후기-오염 간의 공격 시기와 악의적 참가자 가용성이 공격 효율에 미치는 영향을 분석합니다.
- 처리된 업데이트 구성요소에서 PCA를 적용한 차원 축소를 통해 악의적 업데이트를 식별하고 차단하는 방어를 제안합니다.
실험 결과
연구 질문
- RQ1연합학습에서 표적 라벨 반전 공격이 글로벌 모델 유용성을 감소시키는 정도는 어느 정도인가?
- RQ2라벨 플립 공격이 특정 소스/타깃 클래스의 재현율을 다른 클래스보다 더 악화시키는가?
- RQ3공격 시점 및 악의적 참가자 가용성이 FL에서 공격 영향에 어떤 영향을 미치는가?
- RQ4PCA 기반 방어가 악의적 업데이트를 정직한 업데이트와 신뢰성 있게 구분하여 오염을 완화하는가?
주요 결과
- 라벨 플립 공격은 악의적 참가자가 소수에 불과하더라도 글로벌 모델 정확도와 소스 클래스 재현율을 크게 감소시킬 수 있습니다.
- 공격은 표적화되는 경향이 있어 소스 및 타깃 클래스 재현율이 크게 감소하는 반면, 다른 클래스는 비교적 보존됩니다.
- 후기 라운드의 오염 및 악의적 참가자 가용성이 증가하면 공격 효과가 커지지만, 많은 시나리오에서 오염이 끝난 후 모델은 회복될 수 있습니다.
- 처리된 업데이트 구성요소에 PCA를 사용한 방어는 악의적 업데이트를 정직한 업데이트와 구분하여, 집계자가 공격자를 식별하고 차단할 수 있게 합니다.
- 공격 영향은 표적 소스 클래스 재현율에서 다른 지표보다 더 두드러지게 나타나 집중된 포이즈닝 효과를 시사합니다.
더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.