Skip to main content
QUICK REVIEW

[논문 리뷰] Stronger and Faster Wasserstein Adversarial Attacks

Kaiwen Wu, Allen Wang|arXiv (Cornell University)|2020. 08. 06.
Adversarial Robustness in Machine Learning인용 수 11
한 줄 요약

이 논문은 강력하고 빠른 워샤르슈타인 적대적 공격을 생성하기 위해 두 가지 새로운 최적화 방법—정확한 투영을 위한 투영 경사하강법과 엔트로피 스무딩을 통한 빠른 프랭크-울프 알고리즘—을 제안한다. 워샤르슈타인 제약 조건 하에서 정확하고 효율적인 계산을 가능하게 함으로써, 기존 방법에 비해 공격 성공률를 크게 향상시켰으며, 반경 0.005 내에서 CIFAR-10의 ResNet 정확도를 3.4%로 낮추고, 워샤르슈타인 위협 모델 하에서 ImageNet에 대한 첫 번째 성공적인 공격을 가능하게 하였다.

ABSTRACT

Deep models, while being extremely flexible and accurate, are surprisingly vulnerable to "small, imperceptible" perturbations known as adversarial attacks. While the majority of existing attacks focus on measuring perturbations under the $\ell_p$ metric, Wasserstein distance, which takes geometry in pixel space into account, has long been known to be a suitable metric for measuring image quality and has recently risen as a compelling alternative to the $\ell_p$ metric in adversarial attacks. However, constructing an effective attack under the Wasserstein metric is computationally much more challenging and calls for better optimization algorithms. We address this gap in two ways: (a) we develop an exact yet efficient projection operator to enable a stronger projected gradient attack; (b) we show that the Frank-Wolfe method equipped with a suitable linear minimization oracle works extremely fast under Wasserstein constraints. Our algorithms not only converge faster but also generate much stronger attacks. For instance, we decrease the accuracy of a residual network on CIFAR-10 to $3.4\%$ within a Wasserstein perturbation ball of radius $0.005$, in contrast to $65.6\%$ using the previous Wasserstein attack based on an \emph{approximate} projection operator. Furthermore, employing our stronger attacks in adversarial training significantly improves the robustness of adversarially trained models.

연구 동기 및 목표

  • 근사 투영 연산자에 의존하는 기존 워샤르슈타인 적대적 공격의 계산 비효율성과 최적 성능 미달 문제를 해결한다.
  • 투영 경사하강법 공격에서 워샤르슈타인 제약 조건 최적화를 위한 정확하지만 효율적인 투영 방법을 개발한다.
  • 선형 최소화 오라클과 엔트로피 스무딩을 갖춘 빠른 프랭크-울프 알고리즘을 설계하여 워샤르슈타인 제약 조건 하에서 수렴 속도를 가속화한다.
  • 적대적 훈련을 통해 더 강력한 공격의 효과를 입증함으로써 적대적 내성 향상에 기여한다.
  • 이전 방법이 실패한 대규모 데이터셋인 ImageNet에까지 워샤르슈타인 공격의 적용 가능성을 확장한다.

제안 방법

  • 워샤르슈타인 적대적 공격을 커플링 행렬 상의 용량 제약 조건이 있는 유클리드 투영 문제로 재구성하며, 질량 재분배 및 편집 예산 제약 조건을 통합한다.
  • 이중 투영 방법을 제안하여 이중 변수 λ와 μ에 대한 교대 최대화를 통해 제약 최적화 문제를 해결하며, 이분법과 네스테로프 가속 경사상승을 사용한다.
  • 워샤르슈타인 제약 조건 하에서 내림길 방향을 신속하고 확장 가능한 방식으로 계산할 수 있도록 엔트로피 스무딩을 활용한 선형 최소화 오라클을 도입한다.
  • 효율적인 심플렉스 유사 투영과 이중 변수 갱신을 통해 이중 문제를 해결함으로써 선형 수렴 속도를 갖는 이중 투영 알고리즘을 구현한다.
  • 두 알고리즘을 각각 PGD 및 FW 프레임워크에 통합하여 워샤르슈타인 거리 기반으로 고정밀도와 고속도를 동시에 확보한 적대적 예제를 생성한다.
  • 더 강력한 공격을 적대적 훈련에 적용하여 모델의 내성을 향상시키며, 제안된 공격이 평가를 넘어서 방어 연구에서의 유용성을 입증한다.

실험 결과

연구 질문

  • RQ1워샤르슈타인 제약 조건을 가진 적대적 공격에 대해 근사 방법보다 공격 강도를 높일 수 있는 정확한 투영 연산자를 설계할 수 있는가?
  • RQ2효율적인 선형 최소화 오라클을 갖춘 프랭크-울프 방법을 워샤르슈타인 적대적 공격에 적응시켜 수렴 속도를 가속화할 수 있는가?
  • RQ3제안된 방법은 워샤르슈타인 위협 모델 하에서 CIFAR-10과 같은 대규모 데이터셋에서 효과적인 적대적 예제를 생성할 수 있는가?
  • RQ4더 강력한 워샤르슈타인 공격이 적대적 훈련된 모델의 내성을 어느 정도 향상시키는가?
  • RQ5워샤르슈타인 거리가 픽셀 질량 이동을 캡처하는 기하학적 성질은 ℓp 노름에 비해 더 자연스럽고 효과적인 적대적 예제를 어떻게 이끌어내는가?

주요 결과

  • 이중 수식에서 제안된 정확한 투영 방법은 선형 수렴을 달성하며 공격 품질을 크게 향상시켜, 반경 0.005인 워샤르슈타인 반경에서 CIFAR-10의 ResNet 정확도를 3.4%로 낮춘다.
  • 이전 최고 성능의 워샤르슈타인 공격(투영된 싱크호른 기반)은 동일한 편집 예산 하에서 65.6%의 정확도를 기록했으며, 이는 공격 강도의 상당한 향상을 입증한다.
  • 엔트로피 스무딩을 통한 프랭크-울프 방법은 빠른 수렴과 효율적인 계산을 가능하게 하여 대규모 응용에 적합하다.
  • 제안된 공격은 워샤르슈타인 위협 모델 하에서 ImageNet 데이터셋에서 적대적 예제를 성공적으로 생성한 최초의 공격이다.
  • 적대적 훈련에 적용되었을 때, 더 강력한 공격은 모델의 내성 향상에 기여하며, 방어 연구에서의 유용성을 검증한다.
  • 합성 실험을 통해 두 알고리즘이 고정밀도 해에 수렴하는 것으로 확인되었으며, 이중 투영은 정확한 수렴을 달성하고, 프랭크-울프 방법은 선형 수렴 속도를 보였다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.