Skip to main content
QUICK REVIEW

[논문 리뷰] Characterizing Internal Evasion Attacks in Federated Learning

Taejin Kim, Shubhranshu Singh|arXiv (Cornell University)|2022. 09. 17.
Adversarial Robustness in Machine Learning인용 수 6
한 줄 요약

이 논문은 내부 회피 공격(악성 클라이언트가 공유 모델 지식을 악용해 침투성 높고 성공률가 높은 공격을 만드는 공격)에 대응하기 위해 적대적 훈련과 클라이언트별 모델 개인화를 융합한 개인화된 페더레이티드 러닝 프레임워크인 pFedDef을 소개한다. pFedDef는 표준 페더레이티드 적대적 훈련 대비 내부 공격에 대한 강건성을 60% 향상시키며, 자원이 제한된 환경에서도 뛰어난 성능을 유지한다.

ABSTRACT

Federated learning allows for clients in a distributed system to jointly train a machine learning model. However, clients' models are vulnerable to attacks during the training and testing phases. In this paper, we address the issue of adversarial clients performing "internal evasion attacks": crafting evasion attacks at test time to deceive other clients. For example, adversaries may aim to deceive spam filters and recommendation systems trained with federated learning for monetary gain. The adversarial clients have extensive information about the victim model in a federated learning setting, as weight information is shared amongst clients. We are the first to characterize the transferability of such internal evasion attacks for different learning methods and analyze the trade-off between model accuracy and robustness depending on the degree of similarities in client data. We show that adversarial training defenses in the federated learning setting only display limited improvements against internal attacks. However, combining adversarial training with personalized federated learning frameworks increases relative internal attack robustness by 60% compared to federated adversarial training and performs well under limited system resources.

연구 동기 및 목표

  • 페더레이티드 러닝에서 공유된 모델 가중치를 악성 클라이언트가 악용해 효과적인 회피 공격을 만드는 내부 회피 공격의 위협을 규명하는 것.
  • 다양한 데이터 유사도와 페더레이티드 러닝 방법에서 모델 정확도와 강건성 간의 상호 상충 관계를 분석하는 것.
  • 특히 적대자들이 모델 전체 지식을 확보한 화이트박스 환경에서 적대적 훈련이 내부 공격에 대응하는 데 얼마나 효과적인지 평가하는 것.
  • 개인화된 페더레이티드 러닝이 클라이언트 간 모델 유사도를 낮춤으로써 이 위협을 완화할 수 있는지 탐색하는 것.
  • 다양한 훈련 프레임워크 하에서 집단 공격 및 시빌 공격에 대한 페더레이티드 러닝 시스템의 내재적 저항성 조사

제안 방법

  • 각 클라이언트가 개인화된 모델을 유지하면서도 전역 모델 업데이트만 공유하는 개인화된 페더레이티드 러닝에 적대적 훈련을 통합한 pFedDef 프레임워크를 제안한다.
  • 적대자가 수신자 모델에 대한 부분적 지식을 가진 그레이박스 위협 모델을 사용하여, 페더레이션 시스템 내 현실적인 내부 공격 시나리오를 시뮬레이션한다.
  • 페더레이션 집계 과정에서 공유되는 모델 가중치를 활용해 기울기 기반의 회피 공격 생성을 수행하며, 클라이언트 간 전이 가능한 페르튜베이션을 만든다.
  • FedAvg, FedEM 및 적대적 훈련 유무에 따라 변형된 개인화된 변형을 포함한 여러 페더레이션 러닝 방법에서 공격 전이 가능성을 평가한다.
  • 여러 개의 적대적 클라이언트에서 유도된 페르튜베이션을 조합하여 앙상블 공격을 적용함으로써, 협력적 위협을 시뮬레이션한다.
  • 다양한 집계 전략 하에서 레이블 뒤집기 풀링을 통한 시빌 공격에 대한 강건성을 평가하며, 표준 모델과 적대적 훈련된 모델을 비교한다.

실험 결과

연구 질문

  • RQ1클라이언트 간 데이터 유사도 수준이 페더레이티드 러닝에서 내부 회피 공격의 전이 가능성에 어떤 영향을 미치는가?
  • RQ2적대자들이 수신자 모델에 화이트박스 액세스를 가진 경우, 적대적 훈련만으로 내부 회피 공격의 성공률를 얼마나 줄일 수 있는가?
  • RQ3개인화된 페더레이티드 러닝은 모델 정확도를 희생시키지 않고도 내부 회피 공격에 대한 강건성을 향상시킬 수 있는가?
  • RQ4여러 개의 적대적 클라이언트에서 유도된 앙상블 공격은 개인화 유무에 따라 훈련된 페더레이션 모델에 대해 얼마나 효과적인가?
  • RQ5pFedDef 및 기타 프레임워크는 훈련 중 시빌 스타일의 데이터 풀링 공격에 얼마나 내재적으로 저항성이 있는가?

주요 결과

  • 내부 회피 공격은 외부 공격보다 훨씬 효과적이며, 특히 모델 유사도가 높은 FedAvg와 FedEM에서 공격 전이 가능성이 높아져 강력한 영향을 미친다.
  • 적대적 훈련만으로는 내부 공격에 대한 방어가 제한적이며, 적대적 클라이언트가 모델 전체 지식을 악용해 성공적인 회피 페르튜베이션을 생성할 수 있다.
  • 개인화로 인해 클라이언트 간 모델 유사도가 감소함에 따라 pFedDef는 페더레이션 적대적 훈련(FAT) 대비 내부 공격 강건성을 60% 향상시킨다.
  • pFedDef는 여러 개의 적대적 클라이언트가 참여하는 앙상블 공격에도 강건성을 유지하며, FedEM과 FedAvg는 공격자 수가 증가할수록 공격 성공률가 증가하는 것을 보였다.
  • 시빌 공격은 FedEM과 FedAvg의 테스트 정확도를 떨어뜨리지만, FAT와 pFedDef는 훈련 중 적대적 예제에 노출됨으로써 더 높은 내재적 저항성을 보였다.
  • 로컬 훈련과 적대적 로컬 훈련은 공격 단계에 덜 영향을 받는 편이지만, 전체 테스트 정확도가 낮아 강건성과 성능 사이의 상충 관계를 드러냈다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.