[논문 리뷰] Making Substitute Models More Bayesian Can Enhance Transferability of Adversarial Examples
이 논문은 블랙박스 공격에서 적대적 예제의 이동성 향상을 위해 대체 모델에 대한 베이지안 미세조정 방법을 제안한다. 모델 가중치를 확률 분포로 모델링하고 사후 평균을 최적화함으로써, 더 이동성이 높은 교란을 생성하며, ImageNet에서 공격 성공률이 19%p 상승하고, 기존 기법과 조합했을 때 최신 기술을 크게 능가한다.
The transferability of adversarial examples across deep neural networks (DNNs) is the crux of many black-box attacks. Many prior efforts have been devoted to improving the transferability via increasing the diversity in inputs of some substitute models. In this paper, by contrast, we opt for the diversity in substitute models and advocate to attack a Bayesian model for achieving desirable transferability. Deriving from the Bayesian formulation, we develop a principled strategy for possible finetuning, which can be combined with many off-the-shelf Gaussian posterior approximations over DNN parameters. Extensive experiments have been conducted to verify the effectiveness of our method, on common benchmark datasets, and the results demonstrate that our method outperforms recent state-of-the-arts by large margins (roughly 19% absolute increase in average attack success rate on ImageNet), and, by combining with these recent methods, further performance gain can be obtained. Our code: https://github.com/qizhangli/MoreBayesian-attack.
연구 동기 및 목표
- 대체 모델의 다양성을 높임으로써 블랙박스 공격에서 적대적 예제의 이동성을 향상시키기.
- 기존 연구에서 입력 다양성과 역전파에 집중한 반면, 대체 모델 훈련/미세조정에 대한 주목이 부족한 점을 보완하기.
- 효과적인 앙상블 유사 공격 생성을 가능하게 하는 체계적인 베이지안 프레임워크를 개발하기.
- 모델 파라미터의 베이지안 모델링이 다양한 피해자 모델, 특히 강건성 및 비전 트랜스포머 아키텍처에서 적대적 이동성을 향상시킨다는 것을 입증하기.
제안 방법
- 대체 모델의 가중치와 편향을 가우시안 사후 분포를 가진 랜덤 변수로 모델링하여, 불확실성 인식 훈련을 가능하게 한다.
- 공격를 대체 모델의 사후 분포에 대한 기대 적대적 손실을 최대화하는 것으로 설정함으로써, 앙상블 모델을 효과적으로 공격한다.
- 딥 네트워크를 위한 표준 가우시안 사후 근사와 호환되는 베이지안 추론 기반의 체계적인 미세조정 전략을 개발한다.
- 계산 효율성이 표준 훈련과 유사한, 사후 분포를 통한 확률적 최적화를 통해 구현한다.
- 기존의 이동 기반 공격 기법과 호환되며, 성능 향상을 위해 이를 조합할 수 있다.
- 베이지안 대체 모델은 변분 추론을 사용해 훈련되며, 가중치에 대한 사후 분포는 등방향 또는 전체 공분산 가우시안으로 근사된다.
실험 결과
연구 질문
- RQ1베이지안 파라미터 불확실성에 기반한 대체 모델의 다양성 향상이 적대적 예제의 이동성 향상에 기여하는가?
- RQ2기본 결정론적 훈련에 비해 대체 모델의 베이지안 미세조정이 더 강건하고 이동성이 높은 적대적 예제를 생성하는가?
- RQ3비전 트랜스포머 및 강건 모델을 포함한 다양한 피해자 모델에서, 제안된 방법이 최신 기술 수준의 이동 기반 공격와 비교해 성공률 면에서 어떻게 성과를 내는가?
- RQ4기존 공격 기법과 효과적으로 조합될 수 있는가?
주요 결과
- 제안된 방법은 최신 기술 대비 ImageNet에서 평균 공격 성공률을 19%p 상승시켰으며, ILA++와 조합했을 때 성공률가 94.65%에 도달했다.
- ViT-B 및 DeiT-B와 같은 비전 트랜스포머에서 각각 21.66% 및 43.53%의 성공률를 기록했으며, I-FGSM(4.70% 및 5.92%) 및 ILA++(9.48% 및 21.34%)를 크게 능가했다.
- 인증된 강건 모델(스무딩된 ResNet-50)을 공격했을 때, ℓ∞=16/255 조건에서 29.25%의 성공률를 기록했으며, I-FGSM(9.74%) 및 LGV(17.64%)보다 높았다.
- ResNet, VGG, DenseNet, MobileNet, PNASNet 등 다양한 아키텍처에서도 뛰어난 성능를 유지했으며, 기존 기법과 조합했을 때 평균 성공률가 92%를 초과했다.
- 기본 ResNet-50일지라도 베이지안 미세조정만으로도 이동성 향상이 뚜렷하게 나타나, 이는 베이지안 미세조정 자체의 효과를 보여준다.
- ILA++와 조합했을 때 평균 성공률가 94.65%에 도달했으며, PNASNet에서의 최악의 경우 성공률도 84.44%를 기록해 다양한 모델에 걸쳐 강건성을 입증했다.
더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.