[논문 리뷰] (De)Randomized Smoothing for Certifiable Defense against Patch Attacks
이 논문은 블록 및 대역 평활화를 사용한 패치 공격에 대한 derandomized, 구조화된 소거 방어를 제시하여 이미지에 대한 정확하고 인증 가능한 강건성을 제공하며 CIFAR-10에서 ImageNet까지 확장 가능하다.
Patch adversarial attacks on images, in which the attacker can distort pixels within a region of bounded size, are an important threat model since they provide a quantitative model for physical adversarial attacks. In this paper, we introduce a certifiable defense against patch attacks that guarantees for a given image and patch attack size, no patch adversarial examples exist. Our method is related to the broad class of randomized smoothing robustness schemes which provide high-confidence probabilistic robustness certificates. By exploiting the fact that patch attacks are more constrained than general sparse attacks, we derive meaningfully large robustness certificates against them. Additionally, in contrast to smoothing-based defenses against L_p and sparse attacks, our defense method against patch attacks is de-randomized, yielding improved, deterministic certificates. Compared to the existing patch certification method proposed by Chiang et al. (2020), which relies on interval bound propagation, our method can be trained significantly faster, achieves high clean and certified robust accuracy on CIFAR-10, and provides certificates at ImageNet scale. For example, for a 5-by-5 patch attack on CIFAR-10, our method achieves up to around 57.6% certified accuracy (with a classifier with around 83.8% clean accuracy), compared to at most 30.3% certified accuracy for the existing method (with a classifier with around 47.8% clean accuracy). Our results effectively establish a new state-of-the-art of certifiable defense against patch attacks on CIFAR-10 and ImageNet. Code is available at https://github.com/alevine0/patchSmoothing.
연구 동기 및 목표
- 이미지에 대한 물리적 공격을 모형화하는 패치 적대자에 대한 강력한 방어책을 동기 부여한다.
- 패치 공격의 구조적 특성을 활용하여 보호를 향상시키는 인증 가능한 방어책을 개발한다.
- 정확한 강건성 인증서를 얻을 수 있는 블록/대역 소거가 포함된 derandomized 평활 접근법을 제안한다.
- 이 방법이 CIFAR-10, ImageNet과 같은 대규모 데이터셋으로 확장되어 더 우수한 인증 정확도를 제공하는지 보인다.
- 이전 구간 경계 전파 방법과 비교하여 더 빠른 학습 속도와 더 나은 성능을 입증한다.
제안 방법
- 상관된 픽셀 그룹을 유지하여 패치 중첩 확률을 최소화하는 두 가지 구조화된 소거 스킴(블록 평활화와 대역 평활화)을 제안한다.
- 제거된 입력을 갖는 기본 분류기를 사용하고, 클래스별로 retained 블록/대역의 모든 가능한 조합에 대해 투표를 집계하여 각 클래스에 대한 n_c(x)를 형성한다.
- 샘플링 기반 추정이 아니라 클래스 확률의 정확한 계산을 통해 결정적 강건성 인증서를 제공한다.
- 기본 분류기가 불확실할 때 거절 또는 다중 클래스 투표를 허용하기 위한 임계값(theta)을 이용한다.
- 전통적인 L0 무작위 평활화를 derandomize하여 확률적이 아닌 정확한 인증서를 얻는다.
- 대륙 전체를 대상으로 한 실험에서 대역/열차(Columns Smoothing)가 strongest 인증서를 제공함을 경험적으로 확인한다.
실험 결과
연구 질문
- RQ1구조화된 소거(block/band)가 naive sparse 소거에 비해 유지된 픽셀의 패치 공격 교차 확률을 더 효과적으로 감소시키는가?
- RQ2derandomized, 구조화된 평활 접근법이 CIFAR-10 및 ImageNet 규모 과제에서 정확한 강건성 인증서를 제공하고 인증 정확도를 개선하는가?
- RQ3블록 대 대역 평활화 간의 비교에서 다른 패치 크기에서 인증 및 클린 정확도는 어떻게 다른가?
- RQ4ImageNet과 같은 대규모 데이터셋으로 확장하면서 인증 가능한 강건성을 유지할 수 있는가?
- RQ5이전 구간 경계 전파 방법에 비해 실용적 학습 시간 및 구현상의 이점은 무엇인가?
주요 결과
- 대역/열 기반 소거인 열 소거(column smoothing)가 MNIST 및 CIFAR-10에서 블록 소거보다 일관되게 더 높은 인증 정확도를 보인다.
- CIFAR-10에서 5×5 패치의 경우, 이 방법은 57.58%의 인증 정확도와 83.82%의 클린 정확도를 달성하며, Chiang 등(2020)의 30.3% 인증 및 47.8% 클린에 비해 우수하다.
- MNIST에서 본 방법은 52.44%의 인증 정확도와 96.54%의 클린 정확도를 달성한다.
- ImageNet(42×42 패치)에서 이 방법은 13.9%의 인증 정확도와 44.6%의 클린 정확도를 달성한다.
- DERANDOMIZED(구조화된) 평활화는 CIFAR-10에서 무작위화된 대응자보다 인증서를 최대 약 7퍼센트 포인트까지 향상시킨다.
- 이 방법은 ImageNet으로 확장 가능하며, 패치 공격에 대한 이전 인증 가능한 방어책들에 비해 학습 속도를 빠르게 제공한다.
더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.