[논문 리뷰] Training Meta-Surrogate Model for Transferable Adversarial Attack
이 논문은 블랙박스 공격에서 쿼리가 허용되지 않는 환경에서 더 높은 전이성의 적대적 예제를 생성하기 위해 메타-서로가모델(MSM)을 훈련하는 새로운 프레임워크인 메타-트랜스퍼 어택(MTA)을 제안한다. 이는 양면 최적화 문제를 수립하고, 미분 가능한 맞춤형 PGD 어택어를 사용함으로써 전이 성공률를 크게 향상시키며, 특히 적대적으로 훈련된 모델에서 SGM-DI-PGD 대비 최대 96.1% 높은 성공률를 기록한다.
We consider adversarial attacks to a black-box model when no queries are allowed. In this setting, many methods directly attack surrogate models and transfer the obtained adversarial examples to fool the target model. Plenty of previous works investigated what kind of attacks to the surrogate model can generate more transferable adversarial examples, but their performances are still limited due to the mismatches between surrogate models and the target model. In this paper, we tackle this problem from a novel angle -- instead of using the original surrogate models, can we obtain a Meta-Surrogate Model (MSM) such that attacks to this model can be easier transferred to other models? We show that this goal can be mathematically formulated as a well-posed (bi-level-like) optimization problem and design a differentiable attacker to make training feasible. Given one or a set of surrogate models, our method can thus obtain an MSM such that adversarial examples generated on MSM enjoy eximious transferability. Comprehensive experiments on Cifar-10 and ImageNet demonstrate that by attacking the MSM, we can obtain stronger transferable adversarial examples to fool black-box models including adversarially trained ones, with much higher success rates than existing methods. The proposed method reveals significant security challenges of deep models and is promising to be served as a state-of-the-art benchmark for evaluating the robustness of deep models in the black-box setting.
연구 동기 및 목표
- 쿼리가 허용되지 않는 블랙박스 환경에서 적대적 공격의 전이성 부족 문제를 해결하기 위해.
- 학습된 메타-서로가모델(MSM)이 표준 서로가모델보다 전이 가능한 적대적 예제를 더 효과적으로 생성할 수 있는지 조사하기 위해.
- 최대 전이성 확보를 위해 MSM을 최적화하는, 미분 가능하고 종단 간(end-to-end) 훈련 파이프라인을 개발하기 위해.
- 더 강력하고 쿼리 없이 작동하는 블랙박스 공격 기준을 제공함으로써 딥 모델의 강건성 평가를 향상시키기 위해.
제안 방법
- MSM 훈련을 양면 최적화 문제로 수식화하여 MSM에 대한 공격를 펼치고, 그 결과로 타겟 모델로의 전이성을 최적화한다.
- 이산적인 sign 및 ReLU 연산을 arctan 및 시그모이드 함수를 사용한 미분 가능한 근사치로 대체함으로써, 어택 과정을 통해 역전파가 가능하도록 하는 맞춤형 PGD 어택어를 도입한다.
- 이중 손실 목적 함수를 사용: 하나는 MSM에서의 어택 성공률를 최대화하고, 다른 하나는 결과적으로 생성된 적대적 예제의 타겟 모델로의 전이성을 최대화한다.
- MSM 훈련을 위해 소스 모델(예: ResNet-50, Inception-V1)을 지도로 사용하며, MSM에서의 어택가 다른 모델로 일반화될 수 있도록 목표를 설정한다.
- 이중 훈련 과정을 적용: 내부 루프는 맞춤형 PGD를 사용해 MSM에 대해 적대적 공격를 수행하고, 외부 루프는 MSM 파라미터를 업데이트하여 전이성을 극대화한다.
- 훈련된 MSM을 사용해 적대적 예제를 생성하고, 그 결과를 다양한 블랙박스 타겟 모델(적대적으로 훈련된 모델 포함)에서 평가한다.
실험 결과
연구 질문
- RQ1학습된 메타-서로가모델(MSM)이 블랙박스 공격에서 표준 서로가모델보다 전이 가능한 적대적 예제를 더 효과적으로 생성할 수 있는가?
- RQ2MSM 훈련을 어떻게 미분 가능하고 잘 정의된 최적화 문제로 수식화할 수 있으며, 이는 어택 과정을 통해 역전파를 가능하게 하는가?
- RQ3MSM 훈련에서 효과적인 역전파와 높은 전이성을 가능하게 하는 어택 과정의 핵심 구성 요소는 무엇인가?
- RQ4MSM은 최신 기술 대비 자연적으로 훈련된 모델과 적대적으로 훈련된 모델 모두에서 전이 성공률를 얼마나 향상시키는가?
주요 결과
- MTA-PGD는 ImageNet에서 적대적으로 훈련된 Inception-V1 모델을 공격할 때 SGM-DI-PGD 대비 최대 96.1% 높은 전이 공격 성공률를 기록한다.
- MTA-PGD는 적대적으로 훈련된 ResNet-50 및 DenseNet-22BC 모델을 대상으로 각각 SGM-DI-PGD 대비 25.8% 및 45.5% 높은 성공률를 기록한다.
- 제거 실험 결과, 맞춤형 PGD의 arctan 성분이 필수적임을 확인했으며, 이를 제거하면 모든 타겟 모델에서 성능이 17% 이상 감소한다.
- 내부 루프의 어택 반복 수 $T_t$ 는 최적의 값(예: CIFAR-10에서는 7)을 가지며, 이를 초과하면 복잡도 증가로 인해 성능이 저하된다.
- MTA-PGD와 IR-PGD를 조합한 MTA-IR-PGD는 성능을 추가로 향상시켰으며, 이는 기존의 전이성 향상 기법이 MSM 프레임워크와 효과적으로 통합될 수 있음을 시사한다.
- 백본 아키텍처 선택(예: ResNet-13 대비 DenseNet-22BC)이 MSM 성능에 영향을 미치며, 이는 모델 아키텍처 설계가 전이성을 추가로 향상시킬 수 있음을 시사한다.
더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.