Skip to main content
QUICK REVIEW

[논문 리뷰] Improving Adversarial Transferability with Gradient Refining

Guoqiu Wang, Huanqian Yan|arXiv (Cornell University)|2021. 05. 11.
Adversarial Robustness in Machine Learning참고 문헌 23인용 수 5
한 줄 요약

이 논문은 입력 다양성 변환 과정에서 유도되는 부정적 기울기를 보정함으로써 적대적 전이성(transferability)을 향상시키는 Gradient Refining 방법을 제안한다. 여러 변환된 입력에서 기울기를 집계하고 정제함으로써, 최신 기법들보다 평균 6.0% 높은 공격 성공률을 확보하며, 단일 모델 설정에서 ImageNet에서 82.07%의 전이 성공률을 달 đạt한다.

ABSTRACT

Deep neural networks are vulnerable to adversarial examples, which are crafted by adding human-imperceptible perturbations to original images. Most existing adversarial attack methods achieve nearly 100% attack success rates under the white-box setting, but only achieve relatively low attack success rates under the black-box setting. To improve the transferability of adversarial examples for the black-box setting, several methods have been proposed, e.g., input diversity, translation-invariant attack, and momentum-based attack. In this paper, we propose a method named Gradient Refining, which can further improve the adversarial transferability by correcting useless gradients introduced by input diversity through multiple transformations. Our method is generally applicable to many gradient-based attack methods combined with input diversity. Extensive experiments are conducted on the ImageNet dataset and our method can achieve an average transfer success rate of 82.07% for three different models under single-model setting, which outperforms the other state-of-the-art methods by a large margin of 6.0% averagely. And we have applied the proposed method to the competition CVPR 2021 Unrestricted Adversarial Attacks on ImageNet organized by Alibaba and won the second place in attack success rates among 1558 teams.

연구 동기 및 목표

  • 원본 모델에 과적합되는 것을 방지하기 위해 흑상자 환경에서 백상자 적대적 공격의 낮은 전이성 문제를 해결한다.
  • 무작위 변환으로 인해 발생할 수 있는 부정적인 영향을 완화함으로써 입력 다각도에서의 기울기 신호가 유용하지 않거나 반대 방향으로 작용하는 것을 방지한다.
  • 구조적 변경 없이 다양한 모델 간에 강건하고 높은 전이성을 가지는 적대적 예제를 향상시킨다.
  • 기존의 기울기 기반 공격 프레임워크(예: FGSM, PGD, 모멘텀 기반 공격 등)와 호환되는 확장 가능한 플러그인 방식을 개발한다.

제안 방법

  • 단일 입력 이미지에 대해 다수의 무작위이고 미분 가능한 변환을 적용하여 다양한 입력 패턴을 생성한다.
  • 원본 모델을 사용해 각 변환된 입력에 대해 기울기를 계산함으로써, 양의 기울기 신호와 음의 기울기 신호를 모두 포착한다.
  • 모든 변환된 입력에서 기울기를 집계하고, 음의 기울기 성분을 억제하는 보정 메커니즘을 적용한다.
  • 가중 평균 또는 방향 보정 과정을 통해 양의 신호를 조합하고 음의 신호를 상쇄함으로써 최종 기울기를 정제한다.
  • 정제된 기울기를 표준 반복 공격 알고리즘(FGSM, PGD 등)에 통합하여 더 높은 전이성을 가지는 편향을 생성한다.
  • 성능과 계산 비용을 최적화하기 위해 보정 횟수 파라미터(n)를 사용하여 변환 수와 기울기 보정 횟수를 제어한다.

실험 결과

연구 질문

  • RQ1입력 다각도에서의 무작위 변환으로 인한 부정적 영향을 기울기 보정이 효과적으로 줄일 수 있는가?
  • RQ2기본 기법 대비 기울기 보정이 다양한 모델 간 전이성 향상에 얼마나 기여하는가?
  • RQ3기울기 보정을 모멘텀 또는 이동 불변 공격과 통합했을 때 전체 공격 성공률에 어떤 영향을 미치는가?
  • RQ4전이성 향상과 함께, 적대적 예제의 시각적 품질(LPIPS 등)이 유지되거나 향상되는가?
  • RQ5구조적 수정 없이 다양한 공격 프레임워크에 일반화 가능한가?

주요 결과

  • 제안된 R-DTMI-FGSM 방법은 단일 모델 설정에서 세 모델에 대해 평균 82.07%의 전이 성공률을 기록하며, 기준선인 DTMI-FGSM보다 5.93% 높았다.
  • CVPR 2021 Unrestricted Adversarial Attacks on ImageNet 경쟁 대회에서, 1,558개 팀 중 공격 성공률 기준 2위를 기록했다.
  • 절단 실험 결과에서 보정 횟수를 1에서 11로 증가시킬수록 전이 성공률이 향상되었으며, 11회 이상에서는趋세가 둔화됨을 관찰했다.
  • 시각화 결과, 제안된 방법으로 생성된 적대적 편향은 높은 전이성과 함께 더 낮은 LPIPS 값을 보이며 더 낮은 눈에 띄는 정도를 가지는 것으로 확인되었다.
  • DI-FGSM, DTI-FGSM, DTMI-FGSM 등의 다양한 공격 기반 기법에 대해 일관되게 전이 성공률을 향상시켰으며, 평균 6.0%의 향상률을 기록했다.
  • 앙상블 모델 설정에서도 정제된 방법(R-DTMI-FGSM)은 우수한 성능을 유지하였으며, 모델 다양성에 대해 강건하고 일반화 능력이 향상됨을 보였다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.