[논문 리뷰] Transferable Sparse Adversarial Attack
이 논문은 ℓ₀ 노름 제약 조건 하에 이동 가능한 희박한 적대적 공격을 위한 생성자 기반 프레임워크를 제안한다. 흐름을 진폭과 위치 성분으로 분리하고 가용 가능한 0-1 이산화 연산자를 사용함으로써, 기존 최고 수준의 방법들보다 훨씬 높은 이동성과 700배 빠른 추론 속도를 달성한다. ImageNet에서 동일한 희박성 수준에서 GreedyFool보다 최대 50% 높은 이동성을 보이며, 성능을 뛰어나게 한다.
Deep neural networks have shown their vulnerability to adversarial attacks. In this paper, we focus on sparse adversarial attack based on the $\ell_0$ norm constraint, which can succeed by only modifying a few pixels of an image. Despite a high attack success rate, prior sparse attack methods achieve a low transferability under the black-box protocol due to overfitting the target model. Therefore, we introduce a generator architecture to alleviate the overfitting issue and thus efficiently craft transferable sparse adversarial examples. Specifically, the generator decouples the sparse perturbation into amplitude and position components. We carefully design a random quantization operator to optimize these two components jointly in an end-to-end way. The experiment shows that our method has improved the transferability by a large margin under a similar sparsity setting compared with state-of-the-art methods. Moreover, our method achieves superior inference speed, 700$ imes$ faster than other optimization-based methods. The code is available at https://github.com/shaguopohuaizhe/TSAA.
연구 동기 및 목표
- 블랙박스 환경에서 기존 ℓ₀ 희박한 적대적 공격의 낮은 이동성 문제를 해결하기 위해.
- 개별 이미지 최적화가 아닌 다양한 데이터에서 생성자를 훈련시킴으로써 타겟 모델에 대한 과적합을 줄이기 위해.
- 새로운 미분 가능한 이산화 연산자를 통해 희박한 적대적 예제의 엔드 투 엔드 훈련을 가능하게 하기 위해.
- 최소한의 흐름으로 높은 공격 성공률를 달성하면서도 빠른 추론 속도를 유지하기 위해.
- 희박한 적대적 예제가 실세계 응용에서 실제로 이동 가능하고 효율적일 수 있음을 입증하기 위해.
제안 방법
- 이 방법은 적대적 흐름을 진폭과 위치 성분으로 분리하여 별도의 학습 가능한 맵으로 모델링하는 생성자를 사용한다.
- 희박성을 강제하기 위해 위치 맵을 이진화하는 랜덤 이산화 연산자를 도입함으로써, 이산 최적화임에도 불구하고 엔드 투 엔드 훈련이 가능해진다.
- 생성자는 적대적 손실, 위치 맵에 대한 희박성 정규화, 그리고 훈련과 추론 간 일관성을 유지하기 위한 이산화 손실을 조합하여 훈련된다.
- 추론 시 기울기 역전파를 피하기 때문에, 한 번의 순전파로 적대적 예제를 생성할 수 있다.
- 모델은 다양한 이미지에 일반화하기 위해 ImageNet 데이터에서 훈련되어, 특정 타겟 모델에 대한 과적합을 줄인다.
- 이 방법은 ℓ₀ 희박성과 ℓ∞ 노름 제약 조건을 모두 지원하여, 현실적인 조건 하에서의 강건성 평가가 가능하다.
실험 결과
연구 질문
- RQ1다양한 딥 네URAL 네트워크 아키텍처 간에 ℓ₀ 희박한 적대적 예제를 매우 이동 가능하게 만들 수 있는가?
- RQ2큰 데이터셋에서 생성자를 훈련시키는 것이 개별 이미지 최적화보다 타겟 모델에 대한 과적합을 줄이는가?
- RQ3미분 가능한 0-1 이산화 연산자가 희박한 흐름의 엔드 투 엔드 훈련을 효과적으로 가능하게 하는가?
- RQ4진폭과 위치 성분의 분리가 희박한 적대적 예제의 품질과 이동성에 어떻게 기여하는가?
- RQ5ℓ₀ 적대적 공격에서 희박성, 공격 성공률, 추론 속도 사이의 상호 상충 관계는 어떠한가?
주요 결과
- 제안된 방법은 ImageNet에서 InceptionV3에서 ResNet50로의 이동성은 63.76%를 달성하며, 단지 0.46%의 픽셀 흐름으로 이루어졌고, GreedyFool의 15.09%보다 높은 성능을 보였다. 이는 0.67% 희박성에서의 성능이다.
- ℓ∞ ≤ 10 제약 조건 하에서, 이 방법은 14.47%의 희박성으로 45.32%의 이동성을 달성했으며, GreedyFool는 18.19% 희박성에서 10.67%의 이동성을 기록했다.
- 최적화 기반 방법보다 700배 빠른 속도를 기록했으며, 평균적으로 각 적대적 예제 생성에 6ms가 소요되었고, GreedyFool는 20.49초가 걸렸다.
- 제거 실험 결과, 분리와 제안된 이산화 연산자가 필수적임을 확인했다. 이들을 제거하면 이동성이 최대 40% 감소했다.
- 큰 데이터셋에서의 훈련이 이동성 향상에 기여함을 입증했다. '임의의' 실험에서, 이미지별로 훈련한 모델은 43.97%의 이동성을 기록했지만, 제안된 방법은 63.76%의 이동성을 달성했다.
- 백색 상자 공격 성공률도 높게 유지되었으며(InceptionV3에서 61.24%), 블랙박스 이동성에서 기존 기준보다 뚜렷이 뛰어난 성능을 보였다.
더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.