[논문 리뷰] PatchCleanser: Certifiably Robust Defense against Adversarial Patches for Any Image Classifier
PatchCleanser는 예측를 기피하지 않고 악성 패치를 중성화함으로써 적대적 패치 공격에 대해 인증 가능하게 강건한 방어 방법이다. 이는 어떤 이미지 분류기와도 호환되며, ImageNet에서 최상의 성능을 기록한다—정상 이미지 정확도(top-1) 83.9%와 인증 가능 강건 정확도(top-1) 62.1%를 달성한다.
The adversarial patch attack against image classification models aims to inject adversarially crafted pixels within a restricted image region (i.e., a patch) for inducing model misclassification. This attack can be realized in the physical world by printing and attaching the patch to the victim object; thus, it imposes a real-world threat to computer vision systems. To counter this threat, we design PatchCleanser as a certifiably robust defense against adversarial patches. In PatchCleanser, we perform two rounds of pixel masking on the input image to neutralize the effect of the adversarial patch. This image-space operation makes PatchCleanser compatible with any state-of-the-art image classifier for achieving high accuracy. Furthermore, we can prove that PatchCleanser will always predict the correct class labels on certain images against any adaptive white-box attacker within our threat model, achieving certified robustness. We extensively evaluate PatchCleanser on the ImageNet, ImageNette, CIFAR-10, CIFAR-100, SVHN, and Flowers-102 datasets and demonstrate that our defense achieves similar clean accuracy as state-of-the-art classification models and also significantly improves certified robustness from prior works. Remarkably, PatchCleanser achieves 83.9% top-1 clean accuracy and 62.1% top-1 certified robust accuracy against a 2%-pixel square patch anywhere on the image for the 1000-class ImageNet dataset.
연구 동기 및 목표
- 고정도, 최신 기술 기반의 이미지 분류기와 호환되는 인증 가능 강건 방어의 부족을 해결하기 위해.
- 이전 방어 방법이 작은 수신장( receptive field)에 의존하여 정상 정확도를 제한하는 문제를 극복하기 위해.
- 강력한 강건성 보장을 유지하면서도 모델 전용 아키텍처 가정을 제거하기 위해.
- 예측 기피를 피함으로써 안전이 중요한 응용 분야에서의 기능을 보장하기 위해.
- 실세계 패치 공격 위협 모델에서 적응형 화이트박스 공격자에 대해 높은 인증 가능 강건성을 확보하기 위해.
제안 방법
- PatchCleanser는 모든 가능한 이미지 위치에 마스크를 배치하여 첫 번째 라운드의 마스킹을 적용하여 마스킹된 입력을 생성한다.
- 각 마스킹된 이미지에 대해 분류기의 예측을 평가하고, 모든 한 개 마스크가 적용된 예측 중 다수 예측을 식별한다.
- 다수 예측과 다른 예측(불일치자)에 대해서는 추가 마스크를 사용하여 두 번째 라운드의 마스킹을 적용하여 두 개 마스크가 적용된 입력을 생성한다.
- 모든 두 개 마스크가 적용된 예측이 한 개 마스크 불일치자와 일치할 경우, 해당 레이블이 최종 예측으로 출력된다.
- 유해하지 않은 예측이 존재할 경우(예: 패치를 가리키는 마스크가 존재할 경우), 방어는 이를 복구하고 정확히 예측한다.
- 이중 마스킹 과정은 모델 재학습이나 아키텍처 제약 없이도 강건성 인증을 가능하게 한다.
실험 결과
연구 질문
- RQ1기본 분류기의 아키텍처 수정 없이도 적대적 패치에 대해 인증 가능하게 강건한 방어를 설계할 수 있는가?
- RQ2이러한 방어가 높은 정상 정확도를 유지하면서도 강력한 인증 가능 강건성을 확보할 수 있는가?
- RQ3인증 가능 강건 방어에서 예측 기피를 피할 수 있는가? 이는 실세계 시스템에서 지속적인 운영을 보장한다.
- RQ4패치의 위치가 알려져 있지 않고 공격자가 적응형일 경우, 어떻게 적대적 패치를 신뢰성 있게 중성화할 수 있는가?
- RQ5공격자가 방어 메커니즘을 알고 있는 화이트박스 위협 모델 하에서 방어가 강건성 보장을 유지할 수 있는가?
주요 결과
- PatchCleanser는 ImageNet에서 정상 이미지 정확도(top-1) 83.9%를 기록하여 최신 기술 기반의 무방어 모델과 동일한 성능을 달성한다.
- 이 방어는 이미지 어디에나 위치한 2%-픽셀 정사각형 패치에 대해 top-1 인증 가능 강건 정확도 62.1%를 확보한다.
- 이 방어는 아키텍처 제약 없이도 높은 정상 정확도와 높은 인증 가능 강건 정확도를 동시에 달성한 최초의 사례이다.
- PatchCleanser는 이전의 인증 가능 강건 방어보다 뛰어나며, 이는 수신장이 작아서 ImageNet에서 정확도가 약 55%로 제한되는 방식을 피한다.
- 이 방법은 예측 기피 없이 강건한 예측을 가능하게 하여, 예측 지속성이 필수적인 자율 시스템에 적합하다.
- 이중 마스킹 메커니즘은 적응형이자 지능적인 방식으로 배치된 적대적 패치일지라도 정확한 예측을 복구하는 데 성공했다.
더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.