Skip to main content
QUICK REVIEW

[논문 리뷰] Measuring the Transferability of Adversarial Examples

Deyan Petrov, Timothy M. Hospedales|arXiv (Cornell University)|2019. 07. 14.
Adversarial Robustness in Machine Learning참고 문헌 21인용 수 15
한 줄 요약

이 논문은 강력하고 파rameter 최적화된 공격 및 시각적 품질을 측정하기 위해 SSIM를 사용하는 L-infinity 클리핑을 통해 VGG와 Inception 모델 간의 적대적 예제 이동성에 대한 체계적인 평가를 제안한다. 연구 결과 VGG 모델, 특히 앙상블은 Inception 모델보다 더 높은 이동성을 보이며, 시각적 품질 측정에서 SSIM는 L-infinity보다 우수하여 공격 평가에 더 공정한 기준을 제공한다.

ABSTRACT

Adversarial examples are of wide concern due to their impact on the reliability of contemporary machine learning systems. Effective adversarial examples are mostly found via white-box attacks. However, in some cases they can be transferred across models, thus enabling them to attack black-box models. In this work we evaluate the transferability of three adversarial attacks - the Fast Gradient Sign Method, the Basic Iterative Method, and the Carlini & Wagner method, across two classes of models - the VGG class(using VGG16, VGG19 and an ensemble of VGG16 and VGG19), and the Inception class(Inception V3, Xception, Inception Resnet V2, and an ensemble of the three). We also outline the problems with the assessment of transferability in the current body of research and attempt to amend them by picking specific "strong" parameters for the attacks, and by using a L-Infinity clipping technique and the SSIM metric for the final evaluation of the attack transferability.

연구 동기 및 목표

  • 기존 연구에서 파arameter 과적합 및 열 劣한 시각적 메트릭으로 인해 발생하는 일관성 없고 편향된 적대적 이동성 평가 문제를 해결하기 위해.
  • 강력하고 시각적으로 눈에 띄지 않는 파arameter 설정을 사용하여 FGSM, I-FGSM, C&W 공격이 VGG와 Inception 모델 간의 이동성을 평가하기 위해.
  • L-infinity 클리핑과 SSIM를 사용하여 시각적 페르튜베이션을 측정함으로써 평가의 공정성을 향상시키고, 시각적 직관에 의존하는 것을 줄이기 위해.
  • 모델 앙상블이 다양한 공격 유형에 걸쳐 적대적 이동성을 향상시키는지 확인하기 위해.
  • 적대적 공격 이동성을 비교하기 위한 더 체계적이고 정량적인 벤치마크를 제공하기 위해.

제안 방법

  • 저자는 공격의 오차를 최대화하기 위해 최적화된 파arameter를 사용한 강력한 무타겟 적대적 공격(FGSM, I-FGSM, C&W)을 사용하여 소스 모델에서 오분류를 유도한다.
  • 편미네이션 크기를 제어하고 일관된 시각적 왜곡 수준을 갖는 적대적 예제를 생성하기 위해 L-infinity 클리핑을 적용한다.
  • 원본 이미지와 적대적 이미지 간의 SSIM을 계산하여 시각적 유사도를 측정함으로써 인간의 인식과 일치하는 평가 메트릭을 제공한다.
  • 다양한 아키텍처의 타겟 모델에서 적대적 예제의 성공률을 평가하여 이동성을 측정한다.
  • 평가에는 표준 ImageNet 모델 5종(VGG16, VGG19, Inception V3, Xception, Inception ResNet V2)과 앙상블 2종이 포함된다.
  • 결과는 시각적 품질과 공격 효과성을 비교하기 위해 SSIM, L-infinity, Inception Score를 사용하여 분석된다.

실험 결과

연구 질문

  • RQ1강력하고 시각적으로 최적화되지 않은 공격 파arameter는 더 신뢰할 수 있고 일관된 이동성 평가를 이끌어내는가?
  • RQ2SSIM는 적대적 예제의 시각적 품질을 측정할 때 L-infinity에 비해 어떻게 다른가?
  • RQ3다른 적대적 공격에 대해 VGG 또는 Inception 아키텍처 중 어느 것이 더 높은 이동성을 보이는가?
  • RQ4모델 앙상블은 다양한 공격 유형과 파arameter 설정에서 적대적 이동성을 향상시키는가?
  • RQ5표준화된 평가 프레임워크는 이동성 벤치마크에서 편향을 줄이고 공정성을 향상시킬 수 있는가?

주요 결과

  • 모든 공격에서 VGG-앙상블 모델이 가장 높은 이동성을 보이며, 그 다음으로 VGG19, VGG16가 이어지고, Inception 모델은 낮은 이동성을 보인다.
  • FGSM 공격에서 VGG-앙상블은 다른 VGG 모델에서 90% 이상의 성공률을 기록하며 가장 높은 이동성을 확보한다.
  • SSIM는 Inception Score와는 달리 시각적 품질과의 상관관계가 있어, 적대적 이미지 품질 평가에 더 신뢰할 수 있는 메트릭이다.
  • L-infinity와 SSIM 결과는 모든 공격에서 일관되지만, SSIM는 특히 고편미네이션 케이스에서 더 세밀한 성능 차이를 드러낸다.
  • Inception 모델의 앙상블은 이동성을 향상시키지 못하며, 일부 경우(예: C&W 공격에서 LR=7)에서는 개별 모델보다 성능이 열 劣하다.
  • LR=7인 C&W 공격에서 앙상블의 성능이 가장 열 劣하며, 이는 앙상블 평균화가 강력한 공격에 대해 강건성을 향상시키지 못함을 시사한다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.