Skip to main content
QUICK REVIEW

[논문 리뷰] Model Poisoning Attacks to Federated Learning via Multi-Round Consistency

Yueqi Xie, Minghong Fang|arXiv (Cornell University)|2024. 04. 24.
Privacy-Preserving Technologies in Data인용 수 4
한 줄 요약

PoisonedFL은 기존 클라이언트의 데이터나 모델 업데이트에 대한 지식이 없이도 악성 클라이언트 업데이트에서 다중 라운드 일관성을 강제하여 높은 효과를 달성하는 새로운 모델 오염 공격이다. 이는 일곱 가지 기존 공격보다 뛰어나며, 여덟 가지 최신 방어 기법을 무너뜨리며, 페더레이티드 러닝 시스템이 이전에 생각했던 것보다 훨씬 더 취약하다는 것을 입증한다.

ABSTRACT

Model poisoning attacks are critical security threats to Federated Learning (FL). Existing model poisoning attacks suffer from two key limitations: 1) they achieve suboptimal effectiveness when defenses are deployed, and/or 2) they require knowledge of the model updates or local training data on genuine clients. In this work, we make a key observation that their suboptimal effectiveness arises from only leveraging model-update consistency among malicious clients within individual training rounds, making the attack effect self-cancel across training rounds. In light of this observation, we propose PoisonedFL, which enforces multi-round consistency among the malicious clients' model updates while not requiring any knowledge about the genuine clients. Our empirical evaluation on five benchmark datasets shows that PoisonedFL breaks eight state-of-the-art defenses and outperforms seven existing model poisoning attacks. Moreover, we also explore new defenses that are tailored to PoisonedFL, but our results show that we can still adapt PoisonedFL to break them. Our study shows that FL systems are considerably less robust than previously thought, underlining the urgency for the development of new defense mechanisms.

연구 동기 및 목표

  • 방어 기법이 적용된 경우 기존 모델 오염 공격의 효과가 제한적인 문제를 해결하기 위해.
  • 이전 공격들이 진짜 클라이언트의 모델 업데이트 또는 로컬 훈련 데이터에 대한 지식에 의존하는 문제를 해결하기 위해.
  • 여러 훈련 라운드에 걸쳐 일관성 강제가 공격의 지속성과 효과에 크게 기여할 수 있는지 조사하기 위해.
  • 페더레이티드 러닝에서 다양한 최신 방어 기법에 대해 PoisonedFL의 강건성을 평가하기 위해.
  • 페더레이티드 러닝 시스템이 이전에 상상했던 것보다 근본적으로 더 취약하다는 것을 입증하고, 더 강력한 방어 메커니즘의 필요성을 제기하기 위해.

제안 방법

  • PoisonedFL은 모든 훈련 라운드 동안 악성 모델 업데이트가 무작위 부호 벡터와 일치하도록 최적화하여 다중 라운드 일관성을 확보함으로써 누적 효과를 만들어내며, 상호 상쇄를 방지한다.
  • 전체 라운드 최적화 문제를 설정하여, 임의의 방향으로 총 집계된 모델 업데이트의 크기를 최대화하고, 이는 무작위 부호 벡터 $\bm{s}$로 특징화된다.
  • 최적화 문제를 해결하기 위해, 전체 라운드 문제를 각 라운드 별 문제로 변환하며, 각 악성 업데이트는 부호 벡터 $\bm{s}$와 학습 가능한 크기 벡터의 원소별 곱으로 구성된다.
  • 방어 기법에 의해 탐지되거나 필터링되는 것을 방지하기 위해, 매 라운드마다 크기 벡터를 동적으로 조정함으로써 공격의 강도와 은밀함을 균형 잡는다.
  • 서버의 집계 규칙이나 방어 메커니즘에 종속되지 않으며, 진짜 클라이언트 데이터나 모델 업데이트에 대한 액세스가 필요 없다.
  • 크기가 큰 무작위 방향의 업데이트가 모델 정확도를 떨어뜨린다는 관찰을 활용하여, 시간이 지남에 따라 대규모 글로벌 모델 오염을 유도한다.

실험 결과

연구 질문

  • RQ1악성 클라이언트 업데이트에서 다중 라운드 일관성을 강제하는 것이 페더레이티드 러닝에서 모델 오염 공격의 효과를 크게 향상시킬 수 있는가?
  • RQ2진짜 클라이언트 데이터나 모델 업데이트에 대한 의존성이 없기 때문에 PoisonedFL이 기존 공격보다 더 실용적이고 은밀한가?
  • RQ3PoisonedFL은 페더레이티드 러닝에서 여덟 가지 최신 방어 기법을 우회하거나 성능을 저하시킬 수 있는가?
  • RQ4방어 기법이 적용되었을 때 공격 성능은 어떻게 되며, 각 라운드의 필터링 또는 클리핑에도 불구하고 여전히 효과가 유지되는가?
  • RQ5글로벌 모델 트래잭터리에서 복원한 합성 데이터를 사용해 다른 공격을 수행할 수 있는 정도는 어느 정도이며, PoisonedFL과 비교해보면 어떻게 되는가?

주요 결과

  • PoisonedFL은 TrMean 방어 기법 하에서 MNIST에서 중앙값 테스트 오차율 86.49%와 FashionMNIST에서 87.75%를 기록하여, 합성 또는 진짜 로컬 데이터에 의존하는 기존 공격보다 뛰어난 성능을 보였다.
  • TrMean, FLTrust, FLCert를 포함한 여덟 가지 최신 방어 기법을 모두 무너뜨렸으며, 다양한 데이터셋과 방어 기법에서 일관되게 85% 이상의 테스트 오차율을 기록했다.
  • 글로벌 모델 트래잭터리에서 복원한 합성 데이터만을 사용할 경우, 기존 공격는 FashionMNIST에서 최대 27.82%의 테스트 오차율을 기록하지만, PoisonedFL은 이러한 데이터 없이도 87.75%의 오차율을 기록했다.
  • 다중 라운드 일관성 덕분에 이전 공격에서 발생하는 자기 상쇄 문제를 피하면서도, 여러 훈련 라운드에 걸쳐 높은 효과를 유지한다.
  • 방어 기법이 악성 업데이트를 클리핑하거나 필터링하더라도, 동적 크기 조정과 일관된 방향 업데이트 덕분에 PoisonedFL은 여전히 효과가 유지된다.
  • 실험 결과, 다수의 라운드에 걸쳐 일관된 무작위 방향으로 글로벌 모델이 업데이트될 경우 정확도가 심각하게 떨어지는 것으로 확인되어, 공격의 핵심 메커니즘이 검증되었다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.