Skip to main content
QUICK REVIEW

[논문 리뷰] Indiscriminate Data Poisoning Attacks on Neural Networks

Yiwei Lu, Gautam Kamath|arXiv (Cornell University)|2022. 04. 19.
Adversarial Robustness in Machine Learning인용 수 6
한 줄 요약

이 논문은 두 번째 차수 최적화를 사용하여 동시에 수천 개의 오염된 샘플을 생성하는 Total Gradient Descent Ascent (TGDA)를 사용하여 딥 네ural 네트워크에 대한 새로운 효율적인 데이터 오염 공격을 제안한다. 기존 순차적 접근 방식에 비해 공격 효과성과 속도가 크게 향상되었으며, 방어 조치에 대해 강력한 내성과 함께 시각적으로 깨끗하고 구분이 불가능한 오염된 데이터를 생성한다.

ABSTRACT

Data poisoning attacks, in which a malicious adversary aims to influence a model by injecting "poisoned" data into the training process, have attracted significant recent attention. In this work, we take a closer look at existing poisoning attacks and connect them with old and new algorithms for solving sequential Stackelberg games. By choosing an appropriate loss function for the attacker and optimizing with algorithms that exploit second-order information, we design poisoning attacks that are effective on neural networks. We present efficient implementations that exploit modern auto-differentiation packages and allow simultaneous and coordinated generation of tens of thousands of poisoned points, in contrast to existing methods that generate poisoned points one by one. We further perform extensive experiments that empirically explore the effect of data poisoning attacks on deep neural networks.

연구 동기 및 목표

  • 비볼록 딥 네ural 네트워크에 대한 무차별적 데이터 오염 공격에 대한 체계적인 분석 부족을 해결하기 위해.
  • 대규모 모델과 데이터셋에 적용할 경우 기존 순차적 오염 방법의 계산 비용이 지나치게 높아지는 문제를 해결하기 위해.
  • 수천 개의 오염된 데이터 포인트를 동시에 생성할 수 있는 확장성 있고 효율적인 공격 아키텍처를 설계하기 위해.
  • 다양한 데이터 정제 및 방어 메커니즘에 대한 제안된 공격의 내성 평가하기 위해.
  • 현대 딥 네럴 네트워크에 대한 무차별적 데이터 오염 공격의 새로운 벤치마크 설정하기 위해.

제안 방법

  • 공격자가 방어자의 테스트 정확도를 최소화하기 위해 오염된 데이터를 생성하는 비영제로 스택엘베르 게임으로 데이터 오염 공격을 수식화한다.
  • 두 번째 차수 정보를 사용하여 공격자의 목적 함수를 최적화하기 위해 Total Gradient Descent Ascent (TGDA)를 적용하여 수천 개의 오염된 샘플에 대해 효율적인 동시 최적화를 가능하게 한다.
  • 공격자를 별도의 신경망으로 매개변수화하여 엔드 투 엔드 학습이 가능하고 한 번의 순방향 전파로 동시에 오염된 데이터 포인트를 생성할 수 있도록 한다.
  • 방어자의 모델에 대한 전체 지식이 없을 경우, 방어자의 학습 과정을 시뮬레이션하기 위해 서로 가설 모델을 사용한다.
  • 청결한 레이블 설정 하에서 공격을 적용하여 오염된 샘플이 실제 데이터와 시각적으로 구분이 되지 않도록 한다.
  • 제로-서드 및 비영제로 수식 모두를 지원하는 통합 아키텍처를 사용하여 공격 설계의 유연성을 확보한다.

실험 결과

연구 질문

  • RQ1TGDA와 같은 두 번째 차수 최적화 기법이 딥 네럴 네트워크에 대한 데이터 오염 공격의 효율성과 효과성에 크게 기여할 수 있는가?
  • RQ2제안된 동시적 오염 샘플 생성 방식이 순차적 방법에 비해 공격 속도와 성공률 측면에서 어떻게 비교되는가?
  • RQ3손실 기반 정제 방어(예: 손실 기반 필터링, 影향 함수 제거, 기울기 기반 이상치 탐지)에 대해 TGDA 공격의 내성은 어느 정도인가?
  • RQ4방어자의 모델에 대한 지식이 제한적인 상황에서, 서로서 모델에 의존할 경우 공격의 효과는 어떻게 되는가?
  • RQ5제안된 방법은 감시자에 의해 탐지되지 않으면서도 모델 성능을 떨어뜨릴 수 있는 청결한 레이블 오염 데이터를 생성할 수 있는가?

주요 결과

  • TGDA 공격는 기존 최첨단 오염 방법 대비 적어도 한 계단 빠른 학습 속도를 달성하여 한 번의 통과로 수천 개의 오염된 샘플을 생성할 수 있다.
  • CIFAR-10에서 ResNet-18의 테스트 정확도를 오염 예산 ε=5%로 최대 40%까지 떨어뜨릴 수 있었으며, 기존 방법들보다 뚜렷이 뛰어난 성능을 보였다.
  • 손실 기반 방어(예: 손실 기준 상위 3%의 훈련 포인트 제거)에 대해 공격이 강력하게 내성적이었으며, 표본 탐지 가능성에 특별히 제약을 두는 pGAN과 유사한 성능을 달성했다.
  • 영향 함수 기반 방어에는 내성적이지만, 기울기 행렬의 고유값이 높은 포인트를 제거하는 Sever 방어에 의해 상당히 약화되었다.
  • MaxUp은 데이터 증강 방어이지만, TGDA 공격에는 효과가 없었으며, 이는 공격자가 재학습를 예측하기 때문이며, 적대적 예제 설정과는 다름을 보였다.
  • TGDA가 생성한 오염된 샘플은 깨끗한 데이터와 시각적으로 구분이 되지 않아, 청결한 레이블 오염 공격으로서의 성공을 확인했다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.