Skip to main content
QUICK REVIEW

[논문 리뷰] PatchAttack: A Black-box Texture-based Attack with Reinforcement Learning

Chenglin Yang, Adam Kortylewski|arXiv (Cornell University)|2020. 04. 12.
Adversarial Robustness in Machine Learning참고 문헌 52인용 수 12
한 줄 요약

PatchAttack는 강화학습을 사용하여 깊이 신경망의 타겟 및 비타겟 오분류를 위한 질감 텍스처 패치를 쿼리 효율적으로 최적화하는 쿼리 효율적인 블랙박스 공격입니다. VGG 특징 맵에서 유의미한 질감 사전를 학습하고 이러한 패치를 전략적으로 배치함으로써, 비타겟 공격의 경우 이미지의 3%만 수정해도 ImageNet에서 99% 이상의 성공률를 달성하고, 타겟 공격의 경우 평균적으로 10% 미만의 이미지 수정으로도 높은 성능을 기록합니다.

ABSTRACT

Patch-based attacks introduce a perceptible but localized change to the input that induces misclassification. A limitation of current patch-based black-box attacks is that they perform poorly for targeted attacks, and even for the less challenging non-targeted scenarios, they require a large number of queries. Our proposed PatchAttack is query efficient and can break models for both targeted and non-targeted attacks. PatchAttack induces misclassifications by superimposing small textured patches on the input image. We parametrize the appearance of these patches by a dictionary of class-specific textures. This texture dictionary is learned by clustering Gram matrices of feature activations from a VGG backbone. PatchAttack optimizes the position and texture parameters of each patch using reinforcement learning. Our experiments show that PatchAttack achieves > 99% success rate on ImageNet for a wide range of architectures, while only manipulating 3% of the image for non-targeted attacks and 10% on average for targeted attacks. Furthermore, we show that PatchAttack circumvents state-of-the-art adversarial defense methods successfully.

연구 동기 및 목표

  • 타겟 및 비타겟 오분류 모두에 잘 작동하는 쿼리 효율적인 블랙박스 패치 공격을 개발하는 것.
  • 정보가 부족한 단색 패치 공격의 한계를 극복하여, 타겟 설정에서 실패하는 문제를 해결하는 것.
  • 최신 방어 기법, 특히 특징 노이즈 제거 및 형태에 치우친 네트워크를 우회할 수 있는 질감 기반 패치 공격을 설계하는 것.
  • 형태에 민감하도록 훈련된 딥 네트워크가 국소적이고 눈에 띄는 질감 기반 변형에 여전히 취약하다는 것을 보여주는 것.

제안 방법

  • 에이전트가 타겟 모델과 상호작용하여 오분류 보상을 최대화하도록, 패치 배치 및 질감 선택을 강화학습(RL) 의사결정 과정으로 공식화함.
  • 사전 훈련된 VGG 기반 모델의 특징 활성화에서 유도된 그람 행렬을 군집화하여 클래스별 질감 사전를 학습함으로써 현실적인 질감에 대한 효율적 탐색을 가능하게 함.
  • 질감 사전를 사용해 패치 외관을 파arameter화함으로써, 무작위 또는 단색 패치가 아닌 다양한 의미 있는 질감을 탐색할 수 있도록 RL 에이전트를 설계함.
  • 정책 기반 강화학습 방법을 사용해 패치 위치와 질감을 최적화함. 보상은 타겟 클래스에 대한 모델의 오분류율임.
  • 최적화된 위치에 선택된 질감 패치를 입력 이미지에 겹쳐서 적응형 예제를 생성함.
  • 시뮬레이션 루프를 활용함: 패치 위치 및 질감 선택 → 이미지에 적용 → 모델 쿼리 → 보상 수신 → 정책 업데이트

실험 결과

연구 질문

  • RQ1무작위 탐색이나 기울기 없는 최적화에 비해 강화학습 기반 접근이 블랙박스 패치 공격의 쿼리 효율성을 크게 향상시킬 수 있는가?
  • RQ2클래스별 질감 패치를 도입함으로써 단색 패치가 실패하는 타겟 설정에서 공격 성공률가 향상되는가?
  • RQ3질감 기반 패치 공격이 특징 노이즈 제거 및 형태에 치우친 네트워크와 같은 최신 방어 기법을 성공적으로 우회할 수 있는가?
  • RQ4고성공률를 달성하기 위해 얼마나 많은 이미지 영역을 수정해야 하는가? 이는 타겟 및 비타겟 설정 간에 다를까?

주요 결과

  • PatchAttack는 타겟 및 비타겟 공격 모두에서 ImageNet에서 99% 이상의 성공률를 기록하여 이전 연구를 크게 능가함.
  • 비타겟 공격의 경우 평균적으로 이미지의 3%만 수정되며, 평균 쿼리 수가 1,000건 이하임.
  • 타겟 공격의 경우 평균 이미지 영역 수정 비율이 10% 미만이며, 이미지의 10%가 손상된 상태에서 성공률가 99.3%에 이르게 됨.
  • PatchAttack는 흐림 처리 기반 공격에 효과적인 특징 노이즈 제거 방어를 성공적으로 우회하여 뛰어난 내구성을 입증함.
  • 스타일리제이션된 ImageNet으로 훈련된 형태에 치우친 네트워크에 적용했을 때도, 비타겟 설정에서는 정확도를 77.7%에서 0.5%로 감소시키며, 타겟 설정에서는 최소한의 패치 영역으로도 정확도를 100%로 끌어올림.
  • 타겟 설정에서 10% 패치 영역을 사용할 경우 평균적으로 3,822개의 쿼리만 필요하며, 10.31%의 가림 영역을 사용할 경우 9,229개의 쿼리로도 충분함.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.