Skip to main content
QUICK REVIEW

[논문 리뷰] Scratch that! An Evolution-based Adversarial Attack against Neural Networks

Malhar Jere, Rossi, Loris|arXiv (Cornell University)|2019. 12. 05.
Adversarial Robustness in Machine Learning참고 문헌 68인용 수 16
한 줄 요약

이 논문은 공격자가 픽셀의 소수를 수정할 수 있는 제약 조건이 있는 블랙박스 위협 모델 하에서, 국소적이고 파arametric한 흠집 형태의 교란을 제안한다. 이 흠집은 기하학적 형태(선 또는 Bézier 곡선)로 모델링되며, 진화 전략을 통해 진화된다. 이 공격은 ImageNet에서 98.77%의 타겟 공격 성공률과 CIFAR-10에서 97.20%의 성공률을 기록했으며, 수정된 픽셀 비율이 5% 미만이었고, Microsoft의 Cognitive Services Image Captioning API까지 속이는 데 성공하여 실제 적용 가능성임을 입증한다.

ABSTRACT

We study black-box adversarial attacks for image classifiers in a constrained threat model, where adversaries can only modify a small fraction of pixels in the form of scratches on an image. We show that it is possible for adversaries to generate localized extit{adversarial scratches} that cover less than $5\%$ of the pixels in an image and achieve targeted success rates of $98.77\%$ and $97.20\%$ on ImageNet and CIFAR-10 trained ResNet-50 models, respectively. We demonstrate that our scratches are effective under diverse shapes, such as straight lines or parabolic B\a'ezier curves, with single or multiple colors. In an extreme condition, in which our scratches are a single color, we obtain a targeted attack success rate of $66\%$ on CIFAR-10 with an order of magnitude fewer queries than comparable attacks. We successfully launch our attack against Microsoft's Cognitive Services Image Captioning API and propose various mitigation strategies.

연구 동기 및 목표

  • 이미지에 물리적인 흠집을 모방하는 현실적인 블랙박스 공격 기법을 개발하여, 픽셀의 소수만 수정하도록 제약을 둔다.
  • 다양한 형태, 색상, 위치에서 악성 흠집의 효과를 평가하며, 단일 색상 및 단일 흠집 시나리오를 포함한다.
  • Microsoft의 Cognitive Services Image Captioning API를 성공적으로 공격하여 실제 세계 적용 가능성을 입증한다.
  • JPEG 압축, 중앙값 필터링, 픽셀 클리핑과 같은 실용적인 방어 기법을 제안하고 평가한다.

제안 방법

  • 악성 흠집은 공분산 행렬 적응 진화 전략(CMA-ES)을 사용해 매개변수화하여 진화시키며, 흠집 수, 형태(선 또는 Bézier 곡선), 위치, 색상 등의 매개변수를 포함한다.
  • 적합도 함수는 타겟 클래스 예측에 대한 모델의 신뢰도 점수에 기반하며, 모델 출력에 대한 쿼리 접근만으로도 블랙박스 최적화를 가능하게 한다.
  • 실제 API의 쿼터 제한을 시뮬레이션하기 위해 엄격한 쿼리 예산을 적용하여 실용성을 확보한다.
  • 이미지 도메인([0,1] 픽셀 범위 내)과 네트워크 도메인(제약 없음)에서 흠집 생성을 수행하여 더 넓은 공격 표면 평가를 가능하게 한다.
  • 방어 조치는 정상 이미지에서의 복구율과 모델 정확도 저하율을 통해 평가되며, JPEG 압축, 중앙값 필터링, 픽셀 클리핑이 포함된다.
  • 이 방법은 CIFAR-10과 ImageNet에서 ResNet-50, VGG-19, AlexNet에 적용되었으며, 형태, 색상, 위치에 대한 분석 연구도 수행되었다.

실험 결과

연구 질문

  • RQ1블랙박스, 저쿼리, 저픽셀 수정 조건 하에서 국소적이고 기하학적인 교란을 가진 악성 흠집이 높은 타겟 공격 성공률을 달성할 수 있는가?
  • RQ2단일 색상 또는 단일 흠집으로 제약을 받을 경우 악성 흠집의 효율성은 어떻게 되며, 이는 쿼리 효율성에 어떤 영향을 미치는가?
  • RQ3악성 흠집은 Microsoft의 Cognitive Services Image Captioning API와 같은 실제 상용 API를 성공적으로 우회할 수 있는가?
  • RQ4JPEG 압축, 중앙값 필터링 등의 방어 기법 중 어떤 것이 악성 흠집을 효과적으로 억제하면서도 정상 이미지 성능을 유지하는가?
  • RQ5원본-타겟 클래스 간 의미적 유사성과 악성 흠집의 성공률 사이에 상관관계가 있는가?

주요 결과

  • 악성 흠집을 사용해 ImageNet에서 98.77%의 타겟 공격 성공률, CIFAR-10에서 97.20%의 성공률를 달성했으며, 수정된 픽셀 비율은 5% 미만이었다.
  • 극한의 단일 색상, 단일 흠집 조건에서, 비교적 방법보다 약 10배 적은 쿼리로 CIFAR-10에서 66%의 타겟 공격 성공률를 기록했다.
  • 악성 흠집은 Microsoft의 Cognitive Services Image Captioning API를 성공적으로 속여 잘못되거나 전혀 생성되지 않은 캡션을 유도했으며, 실제 공격 가능성임을 입증했다.
  • JPEG 압축(품질 99)은 CIFAR-10 네트워크 도메인 공격에서 가장 높은 복구율(82%)을 기록했고, 정상 이미지에서 정확도 저하율은 0.19%에 불과했다.
  • 중앙값 필터링은 이미지 도메인 공격에서 가장 효과적인 방어 수단이었으며 복구율 81%를 기록했지만, CIFAR-10에서 정확도 저하율이 13.91%로 상당히 높아지며, 강건성과 성능 사이의 상충 관계를 보였다.
  • 이미지 도메인 공격에서는 [0,1] 범위로 클리핑하는 것이 효과가 없었으며 복구율 0%를 기록했지만, 네트워크 도메인에서는 70%의 복구율을 기록해 도메인에 따라 방어 수단의 효율성이 달라짐을 시사했다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.