Skip to main content
QUICK REVIEW

[논문 리뷰] PatchCleanser: Certifiably Robust Defense against Adversarial Patches for Any Image Classifier

Chong Xiang, Saeed Mahloujifar|arXiv (Cornell University)|2021. 08. 20.
Adversarial Robustness in Machine Learning참고 문헌 62인용 수 19
한 줄 요약

PatchCleanser는 예측를 기피하지 않고 악성 패치를 중성화함으로써 적대적 패치 공격에 대해 인증 가능하게 강건한 방어 방법이다. 이는 어떤 이미지 분류기와도 호환되며, ImageNet에서 최상의 성능을 기록한다—정상 이미지 정확도(top-1) 83.9%와 인증 가능 강건 정확도(top-1) 62.1%를 달성한다.

ABSTRACT

The adversarial patch attack against image classification models aims to inject adversarially crafted pixels within a restricted image region (i.e., a patch) for inducing model misclassification. This attack can be realized in the physical world by printing and attaching the patch to the victim object; thus, it imposes a real-world threat to computer vision systems. To counter this threat, we design PatchCleanser as a certifiably robust defense against adversarial patches. In PatchCleanser, we perform two rounds of pixel masking on the input image to neutralize the effect of the adversarial patch. This image-space operation makes PatchCleanser compatible with any state-of-the-art image classifier for achieving high accuracy. Furthermore, we can prove that PatchCleanser will always predict the correct class labels on certain images against any adaptive white-box attacker within our threat model, achieving certified robustness. We extensively evaluate PatchCleanser on the ImageNet, ImageNette, CIFAR-10, CIFAR-100, SVHN, and Flowers-102 datasets and demonstrate that our defense achieves similar clean accuracy as state-of-the-art classification models and also significantly improves certified robustness from prior works. Remarkably, PatchCleanser achieves 83.9% top-1 clean accuracy and 62.1% top-1 certified robust accuracy against a 2%-pixel square patch anywhere on the image for the 1000-class ImageNet dataset.

연구 동기 및 목표

  • 고정도, 최신 기술 기반의 이미지 분류기와 호환되는 인증 가능 강건 방어의 부족을 해결하기 위해.
  • 이전 방어 방법이 작은 수신장( receptive field)에 의존하여 정상 정확도를 제한하는 문제를 극복하기 위해.
  • 강력한 강건성 보장을 유지하면서도 모델 전용 아키텍처 가정을 제거하기 위해.
  • 예측 기피를 피함으로써 안전이 중요한 응용 분야에서의 기능을 보장하기 위해.
  • 실세계 패치 공격 위협 모델에서 적응형 화이트박스 공격자에 대해 높은 인증 가능 강건성을 확보하기 위해.

제안 방법

  • PatchCleanser는 모든 가능한 이미지 위치에 마스크를 배치하여 첫 번째 라운드의 마스킹을 적용하여 마스킹된 입력을 생성한다.
  • 각 마스킹된 이미지에 대해 분류기의 예측을 평가하고, 모든 한 개 마스크가 적용된 예측 중 다수 예측을 식별한다.
  • 다수 예측과 다른 예측(불일치자)에 대해서는 추가 마스크를 사용하여 두 번째 라운드의 마스킹을 적용하여 두 개 마스크가 적용된 입력을 생성한다.
  • 모든 두 개 마스크가 적용된 예측이 한 개 마스크 불일치자와 일치할 경우, 해당 레이블이 최종 예측으로 출력된다.
  • 유해하지 않은 예측이 존재할 경우(예: 패치를 가리키는 마스크가 존재할 경우), 방어는 이를 복구하고 정확히 예측한다.
  • 이중 마스킹 과정은 모델 재학습이나 아키텍처 제약 없이도 강건성 인증을 가능하게 한다.

실험 결과

연구 질문

  • RQ1기본 분류기의 아키텍처 수정 없이도 적대적 패치에 대해 인증 가능하게 강건한 방어를 설계할 수 있는가?
  • RQ2이러한 방어가 높은 정상 정확도를 유지하면서도 강력한 인증 가능 강건성을 확보할 수 있는가?
  • RQ3인증 가능 강건 방어에서 예측 기피를 피할 수 있는가? 이는 실세계 시스템에서 지속적인 운영을 보장한다.
  • RQ4패치의 위치가 알려져 있지 않고 공격자가 적응형일 경우, 어떻게 적대적 패치를 신뢰성 있게 중성화할 수 있는가?
  • RQ5공격자가 방어 메커니즘을 알고 있는 화이트박스 위협 모델 하에서 방어가 강건성 보장을 유지할 수 있는가?

주요 결과

  • PatchCleanser는 ImageNet에서 정상 이미지 정확도(top-1) 83.9%를 기록하여 최신 기술 기반의 무방어 모델과 동일한 성능을 달성한다.
  • 이 방어는 이미지 어디에나 위치한 2%-픽셀 정사각형 패치에 대해 top-1 인증 가능 강건 정확도 62.1%를 확보한다.
  • 이 방어는 아키텍처 제약 없이도 높은 정상 정확도와 높은 인증 가능 강건 정확도를 동시에 달성한 최초의 사례이다.
  • PatchCleanser는 이전의 인증 가능 강건 방어보다 뛰어나며, 이는 수신장이 작아서 ImageNet에서 정확도가 약 55%로 제한되는 방식을 피한다.
  • 이 방법은 예측 기피 없이 강건한 예측을 가능하게 하여, 예측 지속성이 필수적인 자율 시스템에 적합하다.
  • 이중 마스킹 메커니즘은 적응형이자 지능적인 방식으로 배치된 적대적 패치일지라도 정확한 예측을 복구하는 데 성공했다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.