Skip to main content
QUICK REVIEW

[논문 리뷰] DaST: Data-free Substitute Training for Adversarial Attacks

Mingyi Zhou, Jing Wu|arXiv (Cornell University)|2020. 03. 28.
Adversarial Robustness in Machine Learning참고 문헌 41인용 수 13
한 줄 요약

DaST는 실제 데이터 없이 생성적 적대적 네트워크(GANs)를 사용하여 다양하고 레이블 제어가 가능한 훈련 샘플을 합성하는 데이터 프리 대체 훈련 방법을 제안한다. 이는 온라인 Azure 모델에서 98.35%의 공격 성공률를 기록하며, 실제 세계의 블랙박스 공격에서 강한 전이성과 실용성을 입증한다.

ABSTRACT

Machine learning models are vulnerable to adversarial examples. For the black-box setting, current substitute attacks need pre-trained models to generate adversarial examples. However, pre-trained models are hard to obtain in real-world tasks. In this paper, we propose a data-free substitute training method (DaST) to obtain substitute models for adversarial black-box attacks without the requirement of any real data. To achieve this, DaST utilizes specially designed generative adversarial networks (GANs) to train the substitute models. In particular, we design a multi-branch architecture and label-control loss for the generative model to deal with the uneven distribution of synthetic samples. The substitute model is then trained by the synthetic samples generated by the generative model, which are labeled by the attacked model subsequently. The experiments demonstrate the substitute models produced by DaST can achieve competitive performance compared with the baseline models which are trained by the same train set with attacked models. Additionally, to evaluate the practicability of the proposed method on the real-world task, we attack an online machine learning model on the Microsoft Azure platform. The remote model misclassifies 98.35% of the adversarial examples crafted by our method. To the best of our knowledge, we are the first to train a substitute model for adversarial attacks without any real data.

연구 동기 및 목표

  • 실제 훈련 데이터가 전혀 필요 없이 블랙박스 적대적 공격을 위한 대체 모델 훈련 방법을 개발하는 것.
  • 실제 데이터 없이 GAN이 생성한 합성 샘플에서 발생하는 클래스 분포의 불균형 문제를 해결하는 것.
  • 훈련 중에 오직 모델 쿼리만을 사용하여 실제 웹 기반 머신러닝 모델에 효과적인 적대적 공격을 수행할 수 있도록 하는 것.
  • 확률 전용 및 레이블 전용 블랙박스 공격 시나리오에서 모두 방법을 평가하는 것.
  • 실제 설정에서 완전히 합성 데이터로부터 훈련된 대체 모델의 실현 가능성과 강건성을 입증하는 것.

제안 방법

  • 레이블 분포를 제어할 수 있는 다중 브랜치 GAN 아키텍처를 사용하여 합성 데이터를 생성한다.
  • 생성된 샘플의 균형 잡힌 포괄적 클래스 커버리지 확보를 위해 레이블 제어 손실을 도입한다.
  • 대상 공격 모델의 추론을 통해 확보된 레이블을 가진 합성 데이터를 기반으로 대체 모델을 훈련한다.
  • 두 단계 훈련 프로세스를 활용한다: 첫 번째로 GAN이 다양한 합성 샘플을 생성하고, 두 번째로 이러한 쿼리 레이블 기반 샘플을 사용해 대체 모델을 훈련한다.
  • 대상 모델의 출력 유형에 따라 쿼리 인터페이스를 적응시켜 확률 전용 및 레이블 전용 공격 시나리오를 모두 지원한다.
  • 대체 모델에 기반한 기울기 기반 공격 방법(FGSM, BIM, PGD 등)을 사용해 전이 가능한 적대적 예제를 생성한다.

실험 결과

연구 질문

  • RQ1실제 데이터가 전혀 없이도 대체 모델을 효과적으로 훈련시킬 수 있는가?
  • RQ2제안된 레이블 제어 손실과 다중 브랜치 GAN이 합성 데이터의 클래스 불균형 문제를 얼마나 효과적으로 완화하는가?
  • RQ3DaST는 실제 웹 기반 온라인 모델에서 기준 방법 대비 얼마나 높은 공격 성공률를 기록하는가?
  • RQ4DaST는 확률 전용 및 레이블 전용 블랙박스 공격 환경 모두에서 얼마나 잘 작동하는가?
  • RQ5실제 데이터 없이도 합성 데이터만으로 훈련된 DaST가 실제 모델에 높은 전이성을 확보할 수 있는가?

주요 결과

  • DaST는 레이블 전용 쿼리만을 사용하여 마이크로소프트 Azure 온라인 머신러닝 모델에서 98.35%의 공격 성공률를 달성한다.
  • DaST-L(레이블 전용)로 훈련된 대체 모델은 Azure 모델에서 DaST-P(확률 전용)로 훈련된 모델보다 우수한 성능을 보이며, MNIST에서 90.75%의 정확도를 기록한다.
  • DaST-L은 비표적 PGD 공격에서 실데이터 기반 기준 모델 대비 37.74% 높은 공격 성공률를 기록한다.
  • 훈련 중 2000만 건의 쿼리 이후 수렴하며, DaST-L의 공격 성공률는 2000만 쿼리 이후 안정화된다.
  • DaST는 소규모 변형(예: 거리 ≈ 4.72)을 가진 적대적 예제를 생성하며, 쿼리 기반 공격과 유사한 성능을 보이지만 평가 시 쿼리가 필요하지 않다.
  • 시각화 결과는 합성 샘플이 다양하고, 적대적 예제가 인간의 눈으로 인식하기 어려운 것으로 확인되어 효과적인 데이터 생성과 공격 전이를 입증한다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.