Skip to main content
QUICK REVIEW

[논문 리뷰] Trust Region Based Adversarial Attack on Neural Networks

Zhewei Yao, Amir Gholami|arXiv (Cornell University)|2018. 12. 16.
Adversarial Robustness in Machine Learning참고 문헌 9인용 수 7
한 줄 요약

이 논문은 신경망을 속이기 위한 작고 타겟된 변형을 효율적으로 생성하는 트러스트 리전(TR)-기반 적대적 공격 프레임워크를 제안한다. 일阶 및 이阶 TR 최적화를 활용함으로써, Carlini-Wagner(CW) 공격 수준의 공격 성능를 달성하면서 VGG-16에서 최대 37.5배 빠른 추론 시간을 확보하였고, DeepFool보다 변형 크기를 최대 3.9배 감소시켰다.

ABSTRACT

Deep Neural Networks are quite vulnerable to adversarial perturbations. Current state-of-the-art adversarial attack methods typically require very time consuming hyper-parameter tuning, or require many iterations to solve an optimization based adversarial attack. To address this problem, we present a new family of trust region based adversarial attacks, with the goal of computing adversarial perturbations efficiently. We propose several attacks based on variants of the trust region optimization method. We test the proposed methods on Cifar-10 and ImageNet datasets using several different models including AlexNet, ResNet-50, VGG-16, and DenseNet-121 models. Our methods achieve comparable results with the Carlini-Wagner (CW) attack, but with significant speed up of up to $37 imes$, for the VGG-16 model on a Titan Xp GPU. For the case of ResNet-50 on ImageNet, we can bring down its classification accuracy to less than 0.1\% with at most $1.5\%$ relative $L_\infty$ (or $L_2$) perturbation requiring only $1.02$ seconds as compared to $27.04$ seconds for the CW attack. We have open sourced our method which can be accessed at [1].

연구 동기 및 목표

  • 적대적 예제 생성의 계산 비용을 줄이는 더 빠르고 효율적인 적대적 공격 방법을 개발하기.
  • 고도의 이동성과 타겟 가능성 유지와 함께 변형 크기를 최소화하여 공격 성공률를 향상시키기.
  • 일阶 및 이阶 정보를 활용하여 수렴성과 강건성을 향상시키기 위해 트러스트 리전 최적화를 적대적 공격에 적용해 보다 나은 성능를 확보하기.
  • 여러 아키텍처(예: ResNet, VGG, DenseNet)와 데이터셋(CIFAR-10, ImageNet)에서 L2 및 Linfty 노름을 기준으로 다양한 조건에서 성능 평가하기.
  • TR 기반 공격가 최신 기술(예: CW) 수준의 성능를 달성하거나 초월할 수 있으며, 시간과 변형 크기를 크게 줄일 수 있음을 입증하기.

제안 방법

  • 공격는 현재 입력 주변의 제한된 영역(트러스트 리전) 내에서 손실 표면을 국소적인 2차 모델로 근사하는 트러스트 리전 최적화 문제로 공식화된다.
  • 일阶 TR 방법은 기울기 정보를 사용하고, 수렴 속도와 정확도의 균형을 맞추기 위해 트러스트 리전 반경을 적응적으로 조정한다.
  • 적응형 변형은 모델 근사 품질에 기반해 트러스트 리전 반경을 동적으로 조정하여 수동 하이퍼파rameter 조정이 필요 없도록 한다.
  • 이阶 TR 변형은 헤시안 정보를 통합하여 비볼록 손실 표면의 곡률를 더 잘 포착하며, 특히 Swish와 같은 비선형 활성화 함수를 가진 모델에 유리하다.
  • 각 반복에서 이차 제약을 가진 이차계획문(QCQP)을 해결하여 트러스트 리전 내 최적의 변형을 찾는다.
  • 백프로파게이션을 통해 변형을 계산하고 노름 제약 조건을 유지하기 위해 프로젝션을 수행함으로써, 백색 상자 공격에 적용된다.

실험 결과

연구 질문

  • RQ1트러스트 리전 최적화가 변형 크기를 줄이고 효율성을 높이는 데 효과적으로 적용될 수 있는가?
  • RQ2CW 및 DeepFool과 같은 최신 기술 대비 TR 기반 공격의 변형 크기와 계산 시간 측면에서 성능는 어떻게 비교되는가?
  • RQ3헤시안 정보(이阶 정보)를 통합하면 비선형 활성화 함수를 가진 모델에서 공격 강도가 향상되는가?
  • RQ4적응형 트러스트 리전 반경 선택이 수동 하이퍼파rameter 조정이 필요 없이 공격 성능 유지를 또는 향상시킬 수 있는가?
  • RQ5TR 기반 공격가 다양한 아키텍처와 데이터셋(예: ImageNet)에 대해 얼마나 일반화되는가?

주요 결과

  • VGG-16 모델에서 TR 기반 공격는 Carlini-Wagner(CW) 공격 대비 최대 37.5배 빠른 속도를 확보하여 Titan Xp GPU에서 공격 시간을 27.04초에서 1.02초로 단축시켰다.
  • ImageNet의 ResNet-50에서 TR 공격는 Linfty 또는 L2 노름 기준으로 1.5% 이내의 상대적 변형으로 모델 정확도를 0.1% 이하로 낮추었으며, CW 공격 수준의 성능를 달성했지만 훨씬 더 짧은 시간이 소요되었다.
  • WResNet에서 L2 노름 조건 하에 악성 클래스 공격에서 TR 방법은 DeepFool 대비 변형 크기를 최대 3.9배 감소시켰다.
  • VGG-16에서 Linfty 노름 조건 하에 TR 변형은 DeepFool 대비 1.9배 작고 더 정확한 타겟팅 성능를 보여, 정밀도와 침투성 향상을 입증했다.
  • 이阶 TR 변형은 일阶 버전보다 뛰어난 성능를 보였으며, AlexNet에서 2~3회 반복 시 모델 정확도를 추가로 1.2% 감소시켰지만, 계산 비용은 더 높았다.
  • 적응형 TR 변형은 비적응형 버전과 유사한 성능를 확보했으며 수동 조정이 필요 없었고, 보수적인 기본 설정으로 인해 약간의 변형 크기 희생이 있었지만 전체적으로 우수한 성능를 유지했다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.