Skip to main content
QUICK REVIEW

[논문 리뷰] Manipulating SGD with Data Ordering Attacks

Ilia Shumailov, Zakhar Shumaylov|arXiv (Cornell University)|2021. 04. 19.
Adversarial Robustness in Machine Learning참고 문헌 41인용 수 7
한 줄 요약

이 논문은 BRRR 공격—SGD 학습의 확률적 성격을 악용하여 배치 또는 개별 데이터 포인트의 순서를 재정렬하여 모델 학습을 방해하거나 백도어를 삽입하는 데이터 순서 조작 기법을 소개한다. 주요 기여는 깨끗한 데이터와 모델 접근 권한 없이도 공격자가 전략적인 데이터 순서 조작을 통해 모델 정확도를 심각하게 떨어뜨리거나 백도어를 삽입할 수 있음을 입증한 것이다. 화이트박스 BOB는 CIFAR-10에서 91%의 트리거 정확도를 달성하였다.

ABSTRACT

Machine learning is vulnerable to a wide variety of attacks. It is now well understood that by changing the underlying data distribution, an adversary can poison the model trained with it or introduce backdoors. In this paper we present a novel class of training-time attacks that require no changes to the underlying dataset or model architecture, but instead only change the order in which data are supplied to the model. In particular, we find that the attacker can either prevent the model from learning, or poison it to learn behaviours specified by the attacker. Furthermore, we find that even a single adversarially-ordered epoch can be enough to slow down model learning, or even to reset all of the learning progress. Indeed, the attacks presented here are not specific to the model or dataset, but rather target the stochastic nature of modern learning procedures. We extensively evaluate our attacks on computer vision and natural language benchmarks to find that the adversary can disrupt model training and even introduce backdoors.

연구 동기 및 목표

  • SGD 학습 중에 악성 데이터 순서 조작이 데이터나 모델 아키텍처를 수정하지 않고도 모델 학습을 방해하거나 백도어를 삽입할 수 있는지 조사하기 위해.
  • 데이터 배치 및 샘플링 순서 조작을 통해 기밀성 및 가용성 공격이 기계학습 모델에 대해 가능한지 평가하기 위해.
  • 이러한 공격이 모델 파rameter나 훈련 데이터에 접근할 수 없는 블랙박스 환경에서도 효과가 있음을 입증하기 위해.
  • 데이터 순서가 확률적 경사 하강법과 모델 수렴에 영향을 미치는 이론적 배경을 분석하기 위해.
  • 배치 순서를 제어함으로써 오직 깨끗한 데이터와 레이블만으로도 백도어를 삽입할 수 있음을 보여주어 새로운 오염 공격 방식을 가능하게 하기 위해.

제안 방법

  • 세 가지 유형의 데이터 순서 조작 공격(Batch Reordering, Reshuffling, Replacing)을 제안하며, 이를 종합적으로 BRRR 공격라 칭한다.
  • 오직 깨끗한 데이터와 레이블만을 사용하여 모델 파라미터 업데이트를 조작하는 Batch-Order Poisoning(BOP) 및 Batch-Order Backdoor(BOB) 기법을 도입한다.
  • 화이트박스 환경에서는 모델 출력을 기반으로 데이터 재정렬을 유도하기 위해 서rogate 모델을 활용하여 타겟된 백도어 삽입을 가능하게 한다.
  • 블랙박스 공격자 모델은 대상 모델의 기울기나 파라미터에 접근할 수 없지만 최적의 데이터 순서를 추론한다.
  • 다양한 배치 크기를 가진 컴퓨터 비전(CIFAR-10, ImageNet) 및 자연어 처리(NLP, EmbeddingBag, VGG16) 벤치마크에서 공격를 적용한다.
  • 공격 성공도를 측정하기 위해 테스트 정확도, 트리거 정확도, 트리거 입력에 대한 오차율 등의 지표를 평가에 활용한다.

실험 결과

연구 질문

  • RQ1표준 SGD를 사용할 때 데이터 순서만으로도 딥 네URAL 네트워크의 학습 과정을 방해할 수 있는가?
  • RQ2데이터 배치의 순서만으로도 데이터나 모델 아키텍처를 수정하지 않고도 공격자가 모델 행동을 얼마나 제어할 수 있는가?
  • RQ3백도어 삽입을 위한 데이터 순서 조작 공격가 화이트박스 및 블랙박스 환경 모두에서 얼마나 효과적인가?
  • RQ4SGD의 확률적 성격이 데이터 무결성을 유지하면서도 미세한 데이터 재정렬에 의해 모델이 취약해지게 하는가?
  • RQ5아키텍처의 차이(CNN 대비 NLP 모델)가 데이터 순서 기반 백도어 공격의 성공률에 어떤 영향을 미치는가?

주요 결과

  • 단 한 번의 악성으로 재정렬된 에포크만으로도 모델의 전체 학습 진전이 심각하게 저하되거나 심지어 초기화될 수 있다.
  • 화이트박스 BOB는 VGG16을 사용할 때 CIFAR-10에서 91% ± 13의 트리거 정확도를 달성하여 전통적인 오염된 데이터를 사용하는 백도어 공격 수준에 도달한다.
  • 블랙박스 BOB는 동일한 벤치마크에서 68% ± 19의 트리거 정확도를 달성하여 모델 접근 없이도 효과가 있음을 입증한다.
  • NLP 분야에서는 BOB 공격가 백도어를 50개의 쉼표를 트리거로 삼아 성공적으로 삽입하였으며, 화이트박스 조건에서 최대 68.76%의 트리거 정확도를 기록하였다.
  • NLP 모델에서는 더 큰 배치 크기가 백도어 성공률를 감소시켜 배치 수준의 데이터 분포와 임베딩 집계에 민감함을 시사한다.
  • 공격는 모델 및 데이터셋에 관계없이 일반화 가능하며, 이는 모델 특화된 취약점을 노리는 것이 아니라 확률적 학습의 기본 가정을 악용하기 때문이다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.