Skip to main content
QUICK REVIEW

[논문 리뷰] Joint Adversarial Training: Incorporating both Spatial and Pixel Attacks

Haichao Zhang, Jianyu Wang|arXiv (Cornell University)|2019. 07. 24.
Adversarial Robustness in Machine Learning참고 문헌 34인용 수 5
한 줄 요약

이 논문은 깊이 신경망의 강건성을 향상시키기 위해 픽셀 단위의 교란과 공간 변환(예: 회전, 이동)을 동시에 통합하는 공동 적대적 훈련 프레임워크를 제안한다. 훈련 중에 두 공격 유형을 공동으로 최적화하기 위해, 예산 제약이 있는 미분 가능 공간 공격 방법을 도입함으로써, CIFAR10, CIFAR100, SVHN 데이터셋에서 픽셀 공격과 공간 공격 양쪽에 대해 최신 기술 수준(SOTA)의 강건성을 달성한다.

ABSTRACT

Conventional adversarial training methods using attacks that manipulate the pixel value directly and individually, leading to models that are less robust in face of spatial transformation-based attacks. In this paper, we propose a joint adversarial training method that incorporates both spatial transformation-based and pixel-value based attacks for improving model robustness. We introduce a spatial transformation-based attack with an explicit notion of budget and develop an algorithm for spatial attack generation. We further integrate both pixel and spatial attacks into one generation model and show how to leverage the complementary strengths of each other in training for improving the overall model robustness. Extensive experimental results on different benchmark datasets compared with state-of-the-art methods verified the effectiveness of the proposed method.

연구 동기 및 목표

  • 모델이 픽셀 공격에 강건하지만 공간 변환에 취약한 적대적 훈련의 격차를 해소하기 위해.
  • 실제 훈련에 활용 가능한 명시적 예산 제약이 있는, 미분 가능하고 1차 최적화 방법을 갖춘 공간 공격 방법을 개발하기 위해.
  • 픽셀 공격과 공간 공격의 상호보완적 강점을 활용하는 공동 적대적 훈련 프레임워크를 설계하기 위해.
  • 공동 훈련이 픽셀 공격과 공간 공격 양쪽에 대해 강건성을 향상시킴을 경험적으로 검증하기 위해.

제안 방법

  • 신경망에 의해 매개변수화된 플로우 필드를 사용하는, 변환 매개변수에 대해 명시적인 ℓ∞-노름 예산을 가진, 미분 가능한 공간 변환 공격을 도입한다.
  • 투영된 기울기 하강 기반의 1차 최적화 알고리즘을 제안하여 공간 공격 생성을 가능하게 하며, 확장성 있고 효율적인 훈련을 지원한다.
  • 적대적 훈련 중에 픽셀 공격과 공간 공격을 통합된 생성 모델에 통합하고, 공동 최소화 최적화 목표를 사용한다.
  • 공간 변환과 기울기를 계산하기 위해, 기울기 전파를 위한 엔드 투 엔드 가능한, 미분 가능한 렌더러를 사용한다.
  • 각각의 공격에 대해 고정된 예산을 사용하여, 훈련 중에 픽셀 및 공간 공격 모두에 대해 다단계 투영 기반 기울기 하강(PGD) 방법을 적용한다.
  • 훈련 중에 공동 공격 생성을 적용하여, 픽셀 및 공간 영역에서의 교란을 모두 포함하는 적대적 예제를 생성한다.

실험 결과

연구 질문

  • RQ1명시적 예산 제약이 있는, 미분 가능한 공간 공격가 적대적 훈련에 효과적으로 활용될 수 있는가?
  • RQ2픽셀 공격과 공간 공격을 함께 훈련하면 개별 훈련보다 모델의 강건성이 향상되는가?
  • RQ3공동 적대적 훈련 프레임워크는 블랙박스 및 전이 공격 설정에서 어떻게 성능을 보이는가?
  • RQ4픽셀 공격과 공간 공격가 모델 강건성을 향상시키는 데 얼마나 상호보완적인가?

주요 결과

  • CIFAR10에서 제안된 공동 훈련 방법은 공동 공격(εₓ=8, εω=0.3) 하에서 90.5%의 정확도를 달성하여 이전 방법들을 능가했다.
  • CIFAR100에서 모델는 공동 공격 하에서 26.6%의 정확도를 유지했으며, 이는 마드리 기준 모델의 4.8%보다 뚜렷이 높았다.
  • SVHN에서 공동 모델은 공동 공격 하에서 38.8%의 정확도를 기록했으며, 마드리 모델의 19.7%와 양방향 모델의 35.0%를 초월했다.
  • 공동 공격로 훈련된 모델는 블랙박스 공격에서도 강력한 일반화 성능을 보였으며, 공격자가 다른 모델을 사용할 경우 SVHN에서 38.8%의 정확도를 달성했다.
  • 공동 훈련 프레임워크는 공간 공격 뿐만 아니라 표준 픽셀 기반 공격에 대해서도 강건성을 향상시켰으며, 상호보완적 이점을 입증했다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.