[논문 리뷰] Almost Tight L0-norm Certified Robustness of Top-k Predictions against Adversarial Perturbations
이 논문은 랜덤화 제거(randomized ablation)를 사용하여 상위-k 예측에 대해 거의 날카로운 L0-노름 인증된 강건성 보장을 제안한다. 이는 노이즈를 추가하는 대신 특징을 부분적으로 추출하는 랜덤화 스무딩의 변종이다. 이는 최신 기술 수준의 인증된 강건성을 달성하며, 악성 공격자가 최대 5픽셀을 변형시킬 수 있을 때 ImageNet에서 상위-3 정확도가 69.2%에 이를 수 있다.
Top-k predictions are used in many real-world applications such as machine learning as a service, recommender systems, and web searches. $\ell_0$-norm adversarial perturbation characterizes an attack that arbitrarily modifies some features of an input such that a classifier makes an incorrect prediction for the perturbed input. $\ell_0$-norm adversarial perturbation is easy to interpret and can be implemented in the physical world. Therefore, certifying robustness of top-$k$ predictions against $\ell_0$-norm adversarial perturbation is important. However, existing studies either focused on certifying $\ell_0$-norm robustness of top-$1$ predictions or $\ell_2$-norm robustness of top-$k$ predictions. In this work, we aim to bridge the gap. Our approach is based on randomized smoothing, which builds a provably robust classifier from an arbitrary classifier via randomizing an input. Our major theoretical contribution is an almost tight $\ell_0$-norm certified robustness guarantee for top-$k$ predictions. We empirically evaluate our method on CIFAR10 and ImageNet. For instance, our method can build a classifier that achieves a certified top-3 accuracy of 69.2\% on ImageNet when an attacker can arbitrarily perturb 5 pixels of a testing image.
연구 동기 및 목표
- 실제 응용 분야인 ML-as-a-service 및 추천 시스템 등에서 흔한 L0-노름 악성 공격에 대해 상위-k 예측의 인증된 강건성 부족 문제를 해결하기 위해.
- L0-노름 공격에 대해 상위-1 예측에서 상위-k 예측으로의 인증된 강건성 확장을 통해 더 해석 가능하고 물리적으로 실현 가능한 예측을 제공하기 위해.
- L2-노름 보장에서의 열등한 변환 방식을 개선하여, L0-노름 공격 하에서 상위-k 예측에 대해 날카로운 확률적 인증된 강건성 보장을 제공하는 방법을 개발하기 위해.
- CIFAR10 및 ImageNet과 같은 대규모 데이터셋에서의 확장성과 효과성을 입증하기 위해, 3D 딥러닝 작업에도 적용 가능하도록 하기 위해.
제안 방법
- 입력의 특징을 노이즈를 추가하는 대신 부분적으로 추출하는 랜덤화 스무딩의 한 형태인 랜덤화 제거를 사용하여 스무딩 분류기를 구축한다.
- 다수의 제거된 입력에 대해 기본 분류기의 예측 확률을 기반으로 상위-k 레이블을 출력하는 스무딩 분류기를 구성한다.
- 특징의 변형에 따른 레이블 예측 확률 분포를 분석하여 거의 날카로운 L0-노름 인증된 강건성 보장을 유도한다.
- 이산 공간 내에서 확률적 경계와 영역 분할을 활용하여, 특정 L0-노름 반경 이내의 변형에서도 레이블이 상위-k 예측에 유지됨을 증명한다.
- 이미지 분류, 3D 포인트 클라우드 분류(예: ModelNet40)에 적용하여 일반화 능력을 검증하기 위해 PointNet을 기본 분류기로 사용한다.
- 이산 공간 내 엄격한 영역 제약 조건을 완화하여 비연속적 분할 문제를 해결하고, 날카로운 보장을 입증할 수 있도록 한다.
실험 결과
연구 질문
- RQ1L0-노름 악성 공격에 대해 상위-k 예측에 대해 날카로운 인증된 강건성 보장을 달성할 수 있는가?
- RQ2기존의 상위-1 예측만 인증하거나 L2-노름 경계를 사용하는 방법과 비교해, 상위-k 예측의 인증된 강건성은 어떻게 다른가?
- RQ3랜덤화 제거는 강건성 보장이 강화된 상태에서 상위-k 출력 예측을 효과적으로 확장할 수 있는가?
- RQ4실제 L0-변형 설정 하에서 ImageNet 및 ModelNet40와 같은 대규모 벤치마크에서 제안된 방법의 경험적 성능은 어떠한가?
- RQ5이 방법은 다양한 아키텍처와 데이터 모odalities(예: 3D 포인트 클라우드)에 대해 어떻게 확장되고 일반화되는가?
주요 결과
- 공격자가 테스트 이미지의 최대 5픽셀을 변형시킬 수 있을 때, ImageNet에서 상위-3 정확도가 69.2%에 도달한다.
- CIFAR10에서 공격자가 1에서 5픽셀을 변형시킬 경우 각각 상위-1 정확도가 74.6%, 71.8%, 69.0%, 66.0%, 63.6%를 기록하며 이는 이전 연구를 능가한다.
- ModelNet40에서 3D 포인트 클라우드 분류 작업을 수행한 결과, 10개의 포인트가 변형되었을 때 상위-3 정확도가 90.1%였고, 50개의 포인트가 변형되었을 땐 77.5%로 감소한다.
- 최신 기술 수준의 상위-1 L0-강건성 방법인 Chiang 등(2020)에 비해 상당히 뛰어나며, 높은 공격 수준에서 인증 정확도가 두 배 이상 높다.
- 이론적 분석을 통해 상위-k 예측에 대해 거의 날카로운 L0-노름 인증된 강건성 보장을 확립하였으며, 엄격한 이산 영역 제약 조건을 완화함으로써 날카로운 보장을 입증하는 전략을 수립하였다.
- 이 방법은 이미지 외의 분야에도 일반화 가능하며, PointNet을 기본 분류기로 사용하여 3D 딥러닝 작업에서 뛰어난 성능을 보였다.
더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.