[논문 리뷰] Rethinking Model Ensemble in Transfer-based Adversarial Attacks
이 논문은 공통 약점 공격(Common Weakness Attack, CWA)을 제안하며, 이는 전이 기반 적대적 공격의 성능을 햖을하기 위해 손실 곡면의 평탄함과 다수의 서로서티브 모델의 국소 최적점으로의 근접도를 타깃으로 삼는 새로운 방법이다. 샤프nees Aware Minimization와 코사인 유사도 장려기(Cosine Similarity Encourager)를 통합함으로써 CWA는 더 높은 전이 가능성을 가진 적대적 예제를 생성하여, 적대적으로 훈련된 모델에서 로지츠 앙상블을 사용한 MI보다 30% 높은 성공률을 달성한다.
It is widely recognized that deep learning models lack robustness to adversarial examples. An intriguing property of adversarial examples is that they can transfer across different models, which enables black-box attacks without any knowledge of the victim model. An effective strategy to improve the transferability is attacking an ensemble of models. However, previous works simply average the outputs of different models, lacking an in-depth analysis on how and why model ensemble methods can strongly improve the transferability. In this paper, we rethink the ensemble in adversarial attacks and define the common weakness of model ensemble with two properties: 1) the flatness of loss landscape; and 2) the closeness to the local optimum of each model. We empirically and theoretically show that both properties are strongly correlated with the transferability and propose a Common Weakness Attack (CWA) to generate more transferable adversarial examples by promoting these two properties. Experimental results on both image classification and object detection tasks validate the effectiveness of our approach to improving the adversarial transferability, especially when attacking adversarially trained models. We also successfully apply our method to attack a black-box large vision-language model -- Google's Bard, showing the practical effectiveness. Code is available at \url{https://github.com/huanranchen/AdversarialAttacks}.
연구 동기 및 목표
- 모델 앙상블이 단순한 출력 평균화를 넘어서 블랙박스 적대적 공격의 전이 가능성을 향상시키는 이유를 이해하는 것.
- 앙상블 공격이 더 효과적인 배경이 되는 기초적 성질—손실 곡면의 평탄함과 국소 최적점으로의 근접도—를 특정하는 것.
- 다양한 모델들 간의 공통 약점을 명시적으로 최적화하는 원칙적인 방법을 개발하는 것.
- 쿼리 접근이나 높은 계산 비용에 의존하지 않고도, 특히 적대적으로 훈련된 모델에 대해 전이 가능성을 향상시키는 것.
제안 방법
- 앙상블 목적함수를 이차 근사로 기술함으로써, 전이 가능성이 헤시안 행렬의 프로베니우스 노름(평탄함)과 각 모델의 국소 최적점으로의 제곱 L2 거리에 의존한다는 것이 드러났다.
- 손실과 날카움을 동시에 최소화하는 조합 목적함수를 최소화함으로써 손실 곡면의 평탄함을 증진시키기 위해 샤프니스 어웨어 미니멀라이제이션(SAM)을 도입한다.
- 모델 간 기울기를 정렬하기 위해 코사인 유사도 장려기(CSE)를 적용하여 공통 국소 최적점 근처로 수렴하도록 유도한다.
- 기존 최적화 방법(MI, TI, Adam)과 수직적인 관계를 유지하므로, 성능 향상을 위한 추가 통합이 가능하다.
- 이 방법은 이미지 분류 및 객체 검출을 포함한 다양한 분야에서 검증되었으며, 검출기용 유니버설 적대적 패치 생성에도 적용되었다.
- CWA는 계산적으로 효율적이며, 최소한의 반복 수(T=5)에서도 기존 기준보다 뛰어난 성능을 보여, 반복 횟수에 기인한 효과가 아님을 입증한다.
실험 결과
연구 질문
- RQ1왜 모델 앙상블이 단순한 모델 출력 평균화를 넘어서 블랙박스 적대적 공격의 전이 가능성을 향상시키는가?
- RQ2손실 곡면의 기하학적 성질—특히 평탄함과 국소 최적점으로의 근접도—는 적대적 전이 가능성과 어떻게 관련이 있는가?
- RQ3여러 모델 간의 공통 '약점'을 명시적으로 최적화하여 더 높은 전이 가능성을 가진 적대적 예제를 생성할 수 있는가?
- RQ4헤시안 행렬의 노름과 국소 최적점으로의 거리는 앙상블 공격에서 전이 가능성을 얼마나 잘 예측하는가?
- RQ5제안된 방법은 기존 공격 알고리즘과 효과적으로 통합되어 성능 향상을 이룰 수 있는가?
주요 결과
- MI-CWA는 24개의 적대적으로 훈련된 모델에서 로지츠 앙상블을 사용한 MI보다 30% 높은 공격 성공률을 기록하여 뛰어난 전이 가능성을 입증했다.
- CWA가 생성한 적대적 예제 주변의 손실 곡면은 시각화를 통해 여러 방어 모델에서 MI보다 더 평탄한 것으로 확인되었다.
- CWA는 서로서티브 모델과 블랙박스 모델 간 기울기의 코사인 유사도를 크게 향상시켜 공통 약점에 대한 정렬이 잘 이루어졌음을 나타냈다.
- 단지 T=5회의 반복만으로도 CWA는 다른 방법들을 능가했으며, 이는 고도의 계산 비용에 기인한 성능 향상이 아님을 입증한다.
- 객체 검출 분야에서는 Adam-CWA가 8개의 현대적 검출기에서 mAP 9.85를 달성하는 유니버설 적대적 패치를 생성하여 이전 연구를 뛰어넘었다.
- 제거 실험 결과, 평탄함과 국소 최적점으로의 근접도가 모두 핵심 요소이며, 둘 중 하나를 제거하면 성능이 떨어짐을 확인했다.
더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.