Skip to main content
QUICK REVIEW

[논문 리뷰] Deep Partition Aggregation: Provable Defense against General Poisoning Attacks

Alexander Levine, Soheil Feizi|arXiv (Cornell University)|2020. 06. 25.
Adversarial Robustness in Machine Learning인용 수 16
한 줄 요약

이 논문은 일반적인 품질 낮춘 공격과 레이블 뒤집기 공격에 각각 대비하는 새로운 검증된 방어 기법인 딥 파artition 아그리게이션(DPA)과 준감독 DPA(SS-DPA)을 제안한다. 훈련 데이터의 해시 파artition에 기반한 앙상블 모델을 훈련시킴으로써 DPA는 증명 가능한 강건성 보장을 제공한다: 최소 50%의 MNIST 테스트 이미지가 500개 이상의 유해 샘플 삽입에 대해 강건하다고 인증하며, CIFAR-10에서는 최소 9개의 이미지가 9개의 삽입에 대해 강건하다고 인증한다. SS-DPA는 MNIST에서 600개 이상의 레이블 뒤집기를, CIFAR-10에서는 300개 이상의 레이블 뒤집기를 견딜 수 있어 이전의 최고 성능을 초월한다.

ABSTRACT

Adversarial poisoning attacks distort training data in order to corrupt the test-time behavior of a classifier. A provable defense provides a certificate for each test sample, which is a lower bound on the magnitude of any adversarial distortion of the training set that can corrupt the test sample's classification. We propose two novel provable defenses against poisoning attacks: (i) Deep Partition Aggregation (DPA), a certified defense against a general poisoning threat model, defined as the insertion or deletion of a bounded number of samples to the training set -- by implication, this threat model also includes arbitrary distortions to a bounded number of images and/or labels; and (ii) Semi-Supervised DPA (SS-DPA), a certified defense against label-flipping poisoning attacks. DPA is an ensemble method where base models are trained on partitions of the training set determined by a hash function. DPA is related to both subset aggregation, a well-studied ensemble method in classical machine learning, as well as to randomized smoothing, a popular provable defense against evasion attacks. Our defense against label-flipping attacks, SS-DPA, uses a semi-supervised learning algorithm as its base classifier model: each base classifier is trained using the entire unlabeled training set in addition to the labels for a partition. SS-DPA significantly outperforms the existing certified defense for label-flipping attacks on both MNIST and CIFAR-10: provably tolerating, for at least half of test images, over 600 label flips (vs. < 200 label flips) on MNIST and over 300 label flips (vs. 175 label flips) on CIFAR-10. Against general poisoning attacks, where no prior certified defenses exists, DPA can certify >= 50% of test images against over 500 poison image insertions on MNIST, and nine insertions on CIFAR-10. These results establish new state-of-the-art provable defenses against poisoning attacks.

연구 동기 및 목표

  • 공격자가 허용 가능한 수의 훈련 샘플을 삽입하거나 삭제할 수 있는 일반적인 품질 낮춘 공격에 대해 검증된 방어 기법을 개발하는 것.
  • 레이블 뒤집기 공격에 대해 기존의 검증된 방어 기법을 개선하여 더 높은 강건성 임계치를 달성하는 것.
  • 샘플이나 레이블에 대한 임의의 왜곡(레이블 뒤집기, 샘플 삽입 포함)이 발생하더라도 여전히 강건한 증명 가능한 방어 기법을 설계하는 것.
  • 앙상블 학습과 준감독 학습을 활용하여 데이터 분포에 대한 최소한의 가정으로 강력한 인증 보장을 달성하는 것.
  • 청결한 정확도를 유지하면서도 개별 테스트 샘플에 대해 검증 가능한 강건성 인증서를 제공하는 실용적이고 확장 가능한 방어 기법을 제공하는 것.

제안 방법

  • DPA는 훈련 세트의 서로 다른 파artition에 각각 훈련된 기본 분류기들의 앙상블을 구성하며, 파artition는 입력 샘플에 해시 함수를 적용하여 결정된다.
  • 최종 예측은 모든 기본 분류기 간의 다수결 투표를 통해 이루어지며, 인증은 샘플의 예측이 변형에 대해 일관되게 유지되는 최소 파artition 수에서 유도된다.
  • SS-DPA의 경우, 각 기본 분류기는 전체 비라벨 훈련 세트와 자신의 파artition에 속한 라벨된 샘플만을 사용하여 훈련되므로, 더 나은 특징 학습과 강건성을 달성할 수 있다.
  • 인증 메커니즘은 앙상블의 구조와 파artition 간의 레이블 일관성을 활용하여, 최종 예측을 바꾸기 위해 필요한 레이블 뒤집기 또는 샘플 삽입의 최소 수를 하한선으로 계산한다.
  • 샘플 값에 기반한 일관된 파artition 구조 덕분에, 동일한 샘플에 영향을 주는 레이블 뒤집기는 인증 과정에서 단일 변형으로 간주된다.
  • 이 프레임워크는 감독 학습과 자기지도 학습(예: SimCLR) 모두와 호환되며, 특징 품질과 강건성을 향상시킨다.

실험 결과

연구 질문

  • RQ1샘플 삽입, 삭제, 레이블 또는 특징 조작를 포함하는 일반적인 품질 낮춘 공격에 대해 검증 가능한 방어 기법을 구축할 수 있는가?
  • RQ2앙상블 방법을 어떻게 변형하여 데이터 분포에 대한 최소한의 가정으로 품질 낮춘 공격에 대해 증명 가능한 강건성을 확보할 수 있는가?
  • RQ3준감독 학습은 순수 감독 기반 기준 대비 레이블 뒤집기 공격에 대한 검증된 방어 기법의 강건성을 향상시킬 수 있는가?
  • RQ4다수의 테스트 이미지에 대해 정확한 예측을 인증할 수 있는 최대 레이블 뒤집기 수는 얼마인가?
  • RQ5기본 모델 아키텍처와 표현 학습 방법의 선택이 DPA와 SS-DPA의 인증 성능에 어떤 영향을 미치는가?

주요 결과

  • DPA는 최소 50%의 MNIST 테스트 이미지가 500개 이상의 유해 샘플 삽입에 대해 강건하다고 인증하며, 일반적인 품질 낮춘 공격에 대해 이전의 검증된 방어 기법보다 뚜렷이 뛰어나다.
  • CIFAR-10에서는 DPA가 최소 9%의 테스트 이미지에 대해 최소 9개의 삽입에 대해 강건성을 인증하며, 고차원 환경에서도 강력한 증명 가능한 강건성을 입증한다.
  • SS-DPA는 MNIST에서 600개 이상의 레이블 뒤집기, CIFAR-10에서는 300개 이상의 레이블 뒤집기에 대해 검증된 강건성을 확보하며, 이는 각각 이전의 최고 성능인 200개와 175개를 뛰어넘는 성과이다.
  • 히스토그램 평준화를 전처리로 사용하면, 특히 기저 분류기 수(k=100)가 클 경우 GTSRB에서 DPA의 성능이 향상되며, 조명 변화에 더 잘 대응할 수 있다.
  • DPA의 경우, 기저 분류기 수(k)를 늘릴수록 청결한 정확도와 검증된 강건성이 모두 향상되며, k=100일 때 GTSRB에서 77.81%의 청결한 정확도와 21의 중앙값 검증 강건성을 기록한다.
  • SS-DPA는 MNIST에서 89.20%의 높은 청결한 정확도와 중앙값 20의 검증 강건성을 유지하면서, 모든 공격 크기에서 Rosenfeld 등(2020)의 성능을 크게 뛰어넘는 검증된 정확도를 확보한다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.