[논문 리뷰] PatchGuard: Provable Defense against Adversarial Patches Using Masks on Small Receptive Fields.
PatchGuard는 국소적 적대적 패치에 대한 증명 가능하고 강력한 방어책으로, 작은 수용장역할을 가진 컨볼루션 네트워크를 사용하여 오염되는 특징의 수를 제한하고, 이후 오염된 특징을 탐지하고 억제하는 강력한 마스킹 메커니즘을 적용한다. 이는 10개 클래스의 ImageNette에서 86.5%, ImageNet에서 18.6%, CIFAR-10에서 58.1%의 최신 기준을 충족하는 증명 가능한 강력한 정확도를 달성하면서도 높은 정상 정확도를 유지한다.
Localized adversarial patches aim to induce misclassification in machine learning models by arbitrarily modifying pixels within a restricted region of an image. Such attacks can be realized in the physical world by attaching the adversarial patch to the object to be misclassified. In this paper, we propose a general defense framework called PatchGuard that can achieve both high clean accuracy and provable robustness against localized adversarial patches. The cornerstone of PatchGuard is to use convolutional networks with small receptive fields that impose a bound on the number of features corrupted by an adversarial patch. Given a bound on the number of corrupted features, the problem of designing an adversarial patch defense reduces to that of designing a secure feature aggregation mechanism. Towards this end, we present our robust masking defense that robustly detects and masks corrupted features to recover the correct prediction. Our defense achieves state-of-the-art provable robust accuracy on ImageNette (a 10-class subset of ImageNet), ImageNet, and CIFAR-10 datasets. Against the strongest untargeted white-box adaptive attacker, we achieve 94.4% clean accuracy and 86.5% provable robust accuracy on 10-class ImageNette images against an adversarial patch consisting of 1% image pixels, 55.1% clean accuracy and 18.6% provable robust accuracy on 1000-class ImageNet images against a 1% pixel patch, and 84.5% clean accuracy and 58.1% provable accuracy on CIFAR-10 images against a 2.4% pixel patch.
연구 동기 및 목표
- 물리 세계 구현에서 기계 학습 모델을 오도할 수 있는 국소적 적대적 패치의 위협을 다루기 위해.
- 높은 정상 정확도를 유지하면서도 적대적 패치에 대한 증명 가능한 강력성을 확보하는 방어책을 개발하기 위해.
- 컨볼루션 네트워크의 작은 수용장역할을 활용하여 오염되는 특징의 수를 줄이기 위해.
- 적대적 조건 하에서도 오염된 특징을 탐지하고 마스킹할 수 있는 안전한 특징 집합 메커니즘을 설계하기 위해.
- ImageNette, ImageNet, CIFAR-10와 같은 다양한 벤치마크 데이터셋에서 최신 기준의 증명 가능한 강력한 정확도를 달성하기 위해.
제안 방법
- 적대적 패치가 영향을 미치는 특징 수를 제한하기 위해 작은 수용장역할을 가진 컨볼루션 신경망을 사용하기 위해.
- 수용장역할 크기를 바탕으로 오염된 특징 수에 대한 상한을 정의하여 공식적인 강력성 보장을 가능하게 하기 위해.
- 안전한 집계 기법을 사용하여 오염된 특징을 식별하고 억제하는 강력한 마스킹 메커니즘을 설계하기 위해.
- 제한된 오염 모델을 사용하여 방어 문제를 안전한 특징 집계 작업으로 환원하기 위해.
- 인퍼런스 중에 마스킹 메커니즘을 적용하여, 패치가 일부 특징만 오염시키더라도 정확한 예측을 복구하기 위해.
- 마스킹 메커니즘을 포함한 엔드 투 엔드 학습을 통해 적대적 패치 공격 상황에서도 호환성과 강력성을 보장하기 위해.
실험 결과
연구 질문
- RQ1높은 정상 정확도와 국소적 적대적 패치에 대한 증명 가능한 강력성을 동시에 확보할 수 있는 방어책을 설계할 수 있는가?
- RQ2어떻게 작은 수용장역할을 활용하여 오염되는 특징의 수를 제한함으로써 공식적인 강력성 보장을 가능하게 할 수 있는가?
- RQ3적대적 패치 공격 상황 하에서도 신뢰할 수 있게 오염된 특징을 탐지하고 마스킹할 수 있는 안전한 특징 집합 메커니즘이 무엇인가?
- RQ4강력한 화이트박스 적응형 공격자에 대비하여 다양한 데이터셋에서 제안된 방어책의 성능은 어떠한가?
- RQ5ImageNet과 같은 대규모 데이터셋에 대해 효과적으로 확장될 수 있는가? 이때 강력성과 정확도를 유지할 수 있는가?
주요 결과
- PatchGuard는 1% 픽셀 적대적 패치에 대해 10개 클래스의 ImageNette에서 94.4%의 정상 정확도와 86.5%의 증명 가능한 강력한 정확도를 달성한다.
- 1000개 클래스의 전체 ImageNet 데이터셋에서 동일한 1% 패치 공격에 대해 55.1%의 정상 정확도와 18.6%의 증명 가능한 강력한 정확도를 확보한다.
- CIFAR-10에서는 2.4% 픽셀 패치에 대해 84.5%의 정상 정확도와 58.1%의 증명 가능한 강력한 정확도를 달성한다.
- 다양한 데이터셋에서 강력한 성능을 유지하며 확장성과 강력성을 입증한다.
- 작은 수용장역할의 사용은 오염되는 특징의 수를 효과적으로 제한하여 공식적인 강력성 보장을 가능하게 한다.
- 강력한 마스킹 메커니즘은 이미지의 상당 부분이 적대적 패치에 의해 오염되어도 정확한 예측을 성공적으로 복구한다.
더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.