Skip to main content
QUICK REVIEW

[논문 리뷰] Data Poisoning Attacks on Federated Machine Learning

Gan Sun, Yang Cong|arXiv (Cornell University)|2020. 04. 19.
Privacy-Preserving Technologies in Data참고 문헌 19인용 수 14
한 줄 요약

이 논문은 페더레이티드 다중 작업 학습에서 데이터 풀링 공격을 위한 시스템 인지 최적화 방법인 AT2FL을 제안한다. 최적의 공격를 이중 최적화 프로그램으로 공식화하여 유도된 기울기를 계산한다. 실험 결과, AT2FL은 실제 데이터셋에서 모델 성능을 효과적으로 악화시키며, 통신 프로토콜을 통한 간접 공격까지 가능하게 하여 페더레이티드 학습 시스템의 심각한 취약성을 드러낸다.

ABSTRACT

Federated machine learning which enables resource constrained node devices (e.g., mobile phones and IoT devices) to learn a shared model while keeping the training data local, can provide privacy, security and economic benefits by designing an effective communication protocol. However, the communication protocol amongst different nodes could be exploited by attackers to launch data poisoning attacks, which has been demonstrated as a big threat to most machine learning models. In this paper, we attempt to explore the vulnerability of federated machine learning. More specifically, we focus on attacking a federated multi-task learning framework, which is a federated learning framework via adopting a general multi-task learning framework to handle statistical challenges. We formulate the problem of computing optimal poisoning attacks on federated multi-task learning as a bilevel program that is adaptive to arbitrary choice of target nodes and source attacking nodes. Then we propose a novel systems-aware optimization method, ATTack on Federated Learning (AT2FL), which is efficiency to derive the implicit gradients for poisoned data, and further compute optimal attack strategies in the federated machine learning. Our work is an earlier study that considers issues of data poisoning attack for federated learning. To the end, experimental results on real-world datasets show that federated multi-task learning model is very sensitive to poisoning attacks, when the attackers either directly poison the target nodes or indirectly poison the related nodes by exploiting the communication protocol.

연구 동기 및 목표

  • 페더레이티드 다중 작업 학습이 통신 프로토콜 유출에 노출되었을 때의 취약성을 조사한다.
  • 임의의 타겟 및 소스 노드에 적응 가능한 이중 최적화 문제로 최적의 풀링 공격를 공식화한다.
  • 고비용 통신 및 느린 처리자(스트래글러) 등의 시스템 수준 과제를 해결하기 위해 새로운 최적화 프레임워크를 설계한다.
  • 실제 데이터셋에서 무작위 기준과의 비교를 통해 제안된 공격 전략의 효과성을 경험적으로 검증한다.

제안 방법

  • 페더레이티드 다중 작업 학습에서의 데이터 풀링 공격를 이중 최적화 문제로 공식화하며, 상위 레벨은 풀링된 데이터를 최적화하고 하위 레벨은 글로벌 모델을 훈련한다.
  • 소스 노드에서 풀링된 데이터에 대한 유도 기울기를 효율적으로 계산하는 새로운 시스템 인지 최적화 방법인 AT2FL을 도입한다.
  • 이중 최적화 프레임워크 내에서 회귀 및 분류 작업을 모델링하기 위해 손실 함수의 이중 표현(최소 제곱 및 허프 손실)을 사용한다.
  • 식 (4)에서 단계 크기 적응 전략을 사용하여 공격 최적화 중 기울기 신호 강도와 수렴 안정성 간의 균형을 맞춘다.
  • 모델 훈련 과정을 전방으로 전파할 수 있도록 유도 미분을 통해 기울기를 유도한다.
  • 직접 타겟 노드를 풀링하는 것과 통신 프로토콜을 통해 관련된 노드를 간접적으로 풀링하는 전략을 모두 적용한다.

실험 결과

연구 질문

  • RQ1노드 간 통신 프로토콜을 악용하여 페더레이티드 다중 작업 학습에서 데이터 풀링 공격를 효과적으로 수행할 수 있는가?
  • RQ2임의의 타겟 및 소스 노드에 적응 가능한 이중 최적화 문제로 최적의 풀링 공격를 어떻게 공식화할 수 있는가?
  • RQ3고비용 통신 및 스트래글러 등의 시스템 수준 과제가 페더레이티드 학습에서의 데이터 풀링 공격의 실행 가능성과 성능에 어떤 영향을 미치는가?
  • RQ4공격 업데이트 규칙의 단계 크기가 공격 전략의 수렴성과 효과성에 어떤 영향을 미치는가?
  • RQ5공격자가 일부 노드만 손상시켜 관련된 타겟이 아닌 노드에 영향을 주는 간접 공격이 모델 성능을 상당히 악화시킬 수 있는가?

주요 결과

  • 제안된 AT2FL 방법은 EndAD 및 Human Activity Recognition 데이터셋에서 몇 차례 반복 후 국소 최적점에 수렴함을 확인하여 알고리즘의 안정성과 효과성을 입증한다.
  • 단계 크기 η가 증가할수록 공격 성능이 향상되며, 모든 공격 전략이 비공격 기준보다 뛰어나며, 높은 η 값에서 성능이 안정화됨을 확인한다.
  • EndAD 및 Human Activity 데이터셋에서 AT2FL 적용 시 분류 오차가 상당히 증가하여 모델 성능 악화가 효과적으로 이루어졌음을 시사한다.
  • 관련된 노드를 통한 간접 풀링 기반의 공격 전략이 상당한 성능 저하를 초래하여 통신 프로토콜이 원격 손상에 악용될 수 있음을 입증한다.
  • 하위 문제의 원본 비최적성은 반복이 진행될수록 감소함을 확인하여 최적화 과정이 의미 있는 해에 수렴하고 있음을 확인한다.
  • Landmine 및 Parkinson-Total 데이터셋에서의 실험 결과 AT2FL 적용 시 일관된 성능 저하가 관찰되어 공격 전략이 다양한 실제 데이터 분포에 대해 강건함을 검증한다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.