[논문 리뷰] Black-Box Adversarial Attack with Transferable Model-based Embedding
TREMBA는 소스 모델에서 제너레이터를 학습시키고 임베딩 공간에서 NES 기반 탐색을 수행하여 알려지지 않은 타깃을 공격한다는 목표로, 전달 가능한 적대적 섭동을 생성하는 저차원 임베딩을 학습하며 쿼리 효율성과 성공률을 향상시키고, 방어된 모델과 실제 API에서도 효과적이다.
We present a new method for black-box adversarial attack. Unlike previous methods that combined transfer-based and scored-based methods by using the gradient or initialization of a surrogate white-box model, this new method tries to learn a low-dimensional embedding using a pretrained model, and then performs efficient search within the embedding space to attack an unknown target network. The method produces adversarial perturbations with high level semantic patterns that are easily transferable. We show that this approach can greatly improve the query efficiency of black-box adversarial attack across different target network architectures. We evaluate our approach on MNIST, ImageNet and Google Cloud Vision API, resulting in a significant reduction on the number of queries. We also attack adversarially defended networks on CIFAR10 and ImageNet, where our method not only reduces the number of queries, but also improves the attack success rate.
연구 동기 및 목표
- 전이 가능성과 쿼리 효율성의 균형을 맞춘 블랙박스 공격을 제안한다.
- 알려지지 않은 타깃 네트워크를 공격하기 위한 두 단계 프레임워크(생성기 기반 임베딩과 NES 탐색)를 제안한다.
- 임베딩 공간의 섭동이 모델 간에 전달될 수 있는 고수준 의미 패턴을 포착한다는 것을 보인다.
- 방어되지 않은 데이터셋과 방어된 데이터셋 모두에서, 실제 API를 포함해 효과를 입증한다.
제안 방법
- 델타 생성 방식은 delta = epsilon * tanh(D(E(x)))인 E(인코더)와 D(디코더)로 구성된 인코더–디코더 제너레이터 G를 학습하여 섭동을 생성한다.
- C&W 형식에서의 hinge loss를 사용하여 Fs를 속이는 섭동을 형성하도록 Fs라는 화이트박스 소스 네트워크에서 G를 학습한다.
- NES(자연 진화 전략)를 사용하여 저차원 임베딩 z에서 블랙박스 탐색을 수행하여 알려지지 않은 타깃 Ft를 속이는 섭동을 찾고, 부호 정규화를 하지 않은 그래디언트 추정을 통해 z를 업데이트한다.
- z0 = E(x)에서 시작하여 NES에서 도출된 그래디언트를 사용해 zt를 반복적으로 업데이트한 다음 delta = epsilon * tanh(D(zt))를 출력한다.
- z를 중심으로 한 가우시안 섭동 모델을 사용하고 샘플링과 클리핑 단계를 통해 delta를 L-infinity 예산 내로 유지한다; 비타깃 손실과 타깃 손실 모두를 다룬다.
- F s로부터 학습된 고수준 전달 가능한 의미론 때문에 임베딩 공간 탐색이 효과적인 적대적 패턴을 찾는 속도를 높이는 이유를 설명한다.
실험 결과
연구 질문
- RQ1사전 학습된 소스 네트워크에서 학습된 저차원 임베딩이 알려지지 않은 타깃 네트워크에 대해 효율적인 블랙박스 공격을 가능하게 할 수 있을까?
- RQ2임베딩 공간에서 생성된 섭동이 아키텍처와 방어를 넘어 전달될 수 있는 고수준 의미 패턴을 나타내는가?
- RQ3방어되지 않은 모델과 방어된 모델에서의 쿼리 효율성과 성공률, 그리고 실제 세계 API에 대한 성능은 어떠한가?
주요 결과
- TREMBA로 MNIST와 ImageNet에서 기준 블랙박스 공격과 비교하여 최대 2–6배의 쿼리 감소를 달성한다.
- TREMBA로 생성된 섭동은 고수준 의미 패턴(예: 대상 클래스 특징을 닮은 패턴)을 보이며 서로 다른 타깃 모델로도 잘 전달된다.
- AutoZOOM 및 P-RGF 변형을 포함한 경쟁 방법과 비교해 방어된 모델(CIFAR-10 및 ImageNet)에서 더 적은 쿼리로 더 높은 성공률을 달성한다.
- Google Cloud Vision API에서 TREMBA는 베이스라인 방법보다 훨씬 적은 쿼리로 훨씬 높은 성공률을 달성한다.
- 최적화된 시작점 z0* (OSP)를 사용하면 특히 적은 쿼리 수에서 방어된 모델의 성능이 더욱 향상된다.
더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.