Skip to main content
QUICK REVIEW

[논문 리뷰] Patch-wise++ Perturbation for Adversarial Targeted Attacks

Lianli Gao, Qilong Zhang|arXiv (Cornell University)|2020. 12. 31.
Adversarial Robustness in Machine Learning참고 문헌 52인용 수 7
한 줄 요약

이 논문은 영역별 노이즈 증폭과 온도 조절 프로젝션 커널을 사용하여 대상 공격의 이동성(transferability)을 향상시키는 기울기 기반의 대비 공격 방법인 Patch-wise++ (PIM++)을 제안한다. 최첨단 방법에 비해 방어 모델에서 성공률을 33.1% 향상시키고, 일반적으로 훈련된 모델에서 31.4% 향상시키며, 백색 상자 성능는 거의 완벽하게 유지한다.

ABSTRACT

Although great progress has been made on adversarial attacks for deep neural networks (DNNs), their transferability is still unsatisfactory, especially for targeted attacks. There are two problems behind that have been long overlooked: 1) the conventional setting of $T$ iterations with the step size of $ε/T$ to comply with the $ε$-constraint. In this case, most of the pixels are allowed to add very small noise, much less than $ε$; and 2) usually manipulating pixel-wise noise. However, features of a pixel extracted by DNNs are influenced by its surrounding regions, and different DNNs generally focus on different discriminative regions in recognition. To tackle these issues, our previous work proposes a patch-wise iterative method (PIM) aimed at crafting adversarial examples with high transferability. Specifically, we introduce an amplification factor to the step size in each iteration, and one pixel's overall gradient overflowing the $ε$-constraint is properly assigned to its surrounding regions by a project kernel. But targeted attacks aim to push the adversarial examples into the territory of a specific class, and the amplification factor may lead to underfitting. Thus, we introduce the temperature and propose a patch-wise++ iterative method (PIM++) to further improve transferability without significantly sacrificing the performance of the white-box attack. Our method can be generally integrated to any gradient-based attack methods. Compared with the current state-of-the-art attack methods, we significantly improve the success rate by 33.1\% for defense models and 31.4\% for normally trained models on average.

연구 동기 및 목표

  • 블랙박스 환경에서 대상 대비 공격의 제한된 이동성 문제를 해결하기 위해.
  • 다양한 DNN 간의 분류적 영역와 일치하지 않는 전통적인 픽셀 기반 노이즈 증폭의 한계를 극복하기 위해.
  • 공격 성능을 저하시키는 과도한 노이즈 증폭으로 인한 백색 상자 공격 성공률을 희생시키지 않고도 이동성을 향상시키기 위해.
  • 기존 기울기 기반 공격 방법과 호환되는 일반화 가능한 프레임워크를 개발하기 위해.
  • 지역적으로 균일한 노이즈와 온도 스케일링이 DNN 내부의 분류 논리적 구조를 더 효과적으로 활용할 수 있는지 탐구하기 위해.

제안 방법

  • ε 경계를 초과하는 기울기를 프로젝션 커널을 통해 주변 영역로 할당하는 영역 기반 반복적 방법(PIM)을 도입하여, 영역 기반 노이즈 분포를 가능하게 한다.
  • 단계 크기를 점진적으로 증가시키기 위해 증폭 인자를 적용하여, 노이즈의 크기와 분류적 영역의 커버리지 확대를 향상시킨다.
  • 기울기 흐름을 제어하고 증폭으로 인한 대상 공격에서의 과소적합을 완화하기 위해 온도 하이퍼파라미터를 통합한다.
  • 직접 클리핑하는 대신 유용한 기울기 정보를 유지하기 위해 히우리스틱 프로젝션 전략을 활용하여 기울기 초과를 재분배한다.
  • 픽셀의 기울기를 주변 영역으로 확산시키는 프로젝션 커널을 도입하여, 노이즈의 공간적 일관성을 향상시킨다.
  • FGSM 및 그 변종과 같은 기존 공격 방법에 PIM++ 메커니즘을 통합하여 기울기 기반 공격에 일반화할 수 있도록 한다.

실험 결과

연구 질문

  • RQ1픽셀 기반 노이즈에 비해 영역 기반(패치 기반) 노이즈가 대상 대비 예제의 이동성 향상에 기여하는가?
  • RQ2반복 과정에서 단계 크기를 증폭시키는 것이 이동성과 백색 상자 공격 성능에 어떤 영향을 미치는가?
  • RQ3온도 스케일링이 과도한 증폭으로 인한 대상 공격에서의 과소적합을 효과적으로 완화할 수 있는가?
  • RQ4표준 클리핑에 비해 프로젝션 커널이 기울기 정보 손실을 얼마나 줄이는가?
  • RQ5특히 적대적으로 훈련된 모델에 대해 PIM++는 최첨단 공격 방법과 비교해 어떻게 성능을 내는가?

주요 결과

  • PIM++는 블랙박스 모델에서 평균적으로 68.1%의 대상 공격 성공률을 기록하여, DTMPo-FGSM보다 31.4% 높다.
  • 적대적으로 훈련된 모델(EAT)에서 DTPI-FGSM++는 53.4%의 성공률을 기록하여, DTMPo-FGSM보다 33.1% 높다.
  • Hold-out 모델이 Res-101일 경우, DTPI-FGSM++와 DTMPo-FGSM 사이의 성능 격차는 33.9%에 이른다.
  • 백색 상자 환경에서는 PIM++의 모든 변종이 앙상블 모델에서 거의 100%의 성공률을 기록하며, DI-FGSM과 DTMPo-FGSM(90% 미만)을 초월한다.
  • 모델 이동성에 대해 강력한 백색 상자 성능(93% 이상, AoE 기준)을 유지하면서도 블랙박스 이동성은 크게 향상되어, 모델 변화에 대한 강건성을 입증한다.
  • 프로젝션 커널과 온도 메커니즘이 함께 기울기 손실을 줄이고 전역 최적 영역으로의 수렴을 향상시켜 이동성을 강화한다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.