Skip to main content
QUICK REVIEW

[논문 리뷰] Boosting Adversarial Transferability by Block Shuffle and Rotation

Kunyu Wang, Xuanran He|arXiv (Cornell University)|2023. 08. 20.
Adversarial Robustness in Machine Learning인용 수 4
한 줄 요약

이 논문은 블록 랜덤 샤프링과 회전을 통해 이미지의 구조를 파괴함으로써 적대적 예측 이동성(transferability)을 향상시키는 새로운 입력 변환 방법인 Block Shuffle and Rotation (BSR)을 제안한다. 이는 다양한 모델 간 일관된 주의 맵(attention heatmap)을 가능하게 하며, ImageNet에서 최신 기준(SOTA) 성능을 달성하여, 특히 적대적 훈련 및 보호된 모델에 대해 최대 6.0% 높은 공격 성공률을 기록한다.

ABSTRACT

Adversarial examples mislead deep neural networks with imperceptible perturbations and have brought significant threats to deep learning. An important aspect is their transferability, which refers to their ability to deceive other models, thus enabling attacks in the black-box setting. Though various methods have been proposed to boost transferability, the performance still falls short compared with white-box attacks. In this work, we observe that existing input transformation based attacks, one of the mainstream transfer-based attacks, result in different attention heatmaps on various models, which might limit the transferability. We also find that breaking the intrinsic relation of the image can disrupt the attention heatmap of the original image. Based on this finding, we propose a novel input transformation based attack called block shuffle and rotation (BSR). Specifically, BSR splits the input image into several blocks, then randomly shuffles and rotates these blocks to construct a set of new images for gradient calculation. Empirical evaluations on the ImageNet dataset demonstrate that BSR could achieve significantly better transferability than the existing input transformation based methods under single-model and ensemble-model settings. Combining BSR with the current input transformation method can further improve the transferability, which significantly outperforms the state-of-the-art methods. Code is available at https://github.com/Trustworthy-AI-Group/BSR

연구 동기 및 목표

  • 블랙박스 공격에서 적대적 예제의 이동성에 한계가 존재하는 문제, 특히 다양한 모델 간 주의 맵의 일관성 부족 문제를 해결하기 위해.
  • 이미지의 내재된 공간적 구조를 파괴함으로써 주의 맵의 안정성과 일관성을 높여 이동성 향상을 유도할 수 있는지 탐구하기 위해.
  • 다양한 변환된 이미지에서 최적화된 적대적 편향을 통해 주의 맵의 분산을 줄이는 새로운 입력 변환 기반 공격을 개발하기 위해.
  • 강력한 방어 기법, 특히 인증 방어 및 노이즈 제거 방어를 대상으로 BSR의 효과를 평가하여, 실제 세계에서의 위협 잠재력과 강건성을 입증하기 위해.

제안 방법

  • 입력 이미지를 겹치지 않는 고정된 수의 블록으로 분할하여 공간적 일관성을 파괴한다.
  • 각 블록을 정해진 범위 내에서 랜덤으로 재배열하고, 랜덤 각도로 회전하여 다수의 변환된 이미지를 생성한다.
  • N개의 이러한 변환된 이미지 간 평균 기울기를 사용하여 적대적 편향을 최적화함으로써 학습의 안정성과 분산을 감소시킨다.
  • 원본 모델에서 주의 맵을 파괴하면서도 의미적 콘텐츠는 유지함으로써 효과적인 이동성을 확보하기 위해 랜덤 변환(셔플링 및 회전)을 적용한다.
  • BSR은 기존의 이동 기반 공격과 호환되며, TI-DIM 또는 SIM과 같은 기법과 조합하여 성능을 더욱 향상시킬 수 있다.
  • 블록 수(n), 변환된 이미지 수(N), 그리고 회전 각도 범위(τ)는 부정확도 분석을 통해 최적화되어 있으며, 파괴 효과와 최적화 안정성 간의 균형을 맞추기 위한 하이퍼파라미터이다.
Raw Image
Raw Image

실험 결과

연구 질문

  • RQ1블록 샤프링과 회전을 통해 이미지의 내재된 공간적 구조를 파괴하면, 다양한 모델 간 더 일관된 주의 맵을 얻을 수 있는가?
  • RQ2다양한 주의 맵을 가진 다수의 변환된 이미지에서 적대적 편향을 최적화하는 것이, 기존의 표준 입력 변환 방법에 비해 이동성을 향상시키는가?
  • RQ3블록 수, 변환된 이미지 수, 회전 각도 범위와 같은 하이퍼파라미터가 BSR의 성능에 미치는 영향은 어떠한가?
  • RQ4강력한 방어 기법, 예를 들어 적대적 훈련 및 인증 방어 기법에 대해서도 BSR은 높은 이동성을 유지할 수 있는가?
  • RQ5단일 모델 및 앙상블 설정 모두에서 BSR은 최신 기준 이동 기반 공격에 비해 공격 성공률 측면에서 어떻게 비교되는가?

주요 결과

  • BSR은 적대적 훈련된 모델에 대해 ImageNet에서 평균 98.4%의 공격 성공률을 기록하며, Admix-TI-DIM보다 최소 6.0% 높은 성능을 보였다.
  • 스케일 불변 기법(SIM)과 조합한 BSR-SI-TI-DIM는 평균 94.1%의 공격 성공률을 기록하여, Admix-TI-DIM보다 5.0% 높은 성능을 보였다.
  • 인증 방어 기법 RS와 강력한 노이즈 제거기 NRP에 대해선 각각 83.9% 및 84.2%의 성공률을 기록하여, Admix-TI-DIM보다 각각 11.3% 및 3.8% 높은 성능을 보였다.
  • 부정확도 분석 결과, n=2개 블록, N=20개의 변환 이미지, τ=24°의 회전 범위가 성능 최적화에 가장 유리한 조합임을 확인하였다. 이는 파괴 효과와 최적화 안정성 간의 균형을 잘 맞춘 조합이었다.
  • 블록 샤프링(BS)과 블록 회전(BR)만으로도 MI-FGSM에 비해 이동성 향상을 보였지만, 양자를 조합한 BSR이 가장 높은 성능을 기록하여 상호보완적 효과를 입증하였다.
  • 모델 간 주의 맵의 분산을 크게 감소시켜, 일관된 주의 패턴이 이동성 향상에 기여한다는 가설을 실험적으로 검증하였다.
Shuffled Image
Shuffled Image

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.