Skip to main content
QUICK REVIEW

[논문 리뷰] Almost Tight L0-norm Certified Robustness of Top-k Predictions against Adversarial Perturbations

Jinyuan Jia, Binghui Wang|arXiv (Cornell University)|2020. 11. 15.
Adversarial Robustness in Machine Learning참고 문헌 60인용 수 5
한 줄 요약

이 논문은 랜덤화 제거(randomized ablation)를 사용하여 상위-k 예측에 대해 거의 날카로운 L0-노름 인증된 강건성 보장을 제안한다. 이는 노이즈를 추가하는 대신 특징을 부분적으로 추출하는 랜덤화 스무딩의 변종이다. 이는 최신 기술 수준의 인증된 강건성을 달성하며, 악성 공격자가 최대 5픽셀을 변형시킬 수 있을 때 ImageNet에서 상위-3 정확도가 69.2%에 이를 수 있다.

ABSTRACT

Top-k predictions are used in many real-world applications such as machine learning as a service, recommender systems, and web searches. $\ell_0$-norm adversarial perturbation characterizes an attack that arbitrarily modifies some features of an input such that a classifier makes an incorrect prediction for the perturbed input. $\ell_0$-norm adversarial perturbation is easy to interpret and can be implemented in the physical world. Therefore, certifying robustness of top-$k$ predictions against $\ell_0$-norm adversarial perturbation is important. However, existing studies either focused on certifying $\ell_0$-norm robustness of top-$1$ predictions or $\ell_2$-norm robustness of top-$k$ predictions. In this work, we aim to bridge the gap. Our approach is based on randomized smoothing, which builds a provably robust classifier from an arbitrary classifier via randomizing an input. Our major theoretical contribution is an almost tight $\ell_0$-norm certified robustness guarantee for top-$k$ predictions. We empirically evaluate our method on CIFAR10 and ImageNet. For instance, our method can build a classifier that achieves a certified top-3 accuracy of 69.2\% on ImageNet when an attacker can arbitrarily perturb 5 pixels of a testing image.

연구 동기 및 목표

  • 실제 응용 분야인 ML-as-a-service 및 추천 시스템 등에서 흔한 L0-노름 악성 공격에 대해 상위-k 예측의 인증된 강건성 부족 문제를 해결하기 위해.
  • L0-노름 공격에 대해 상위-1 예측에서 상위-k 예측으로의 인증된 강건성 확장을 통해 더 해석 가능하고 물리적으로 실현 가능한 예측을 제공하기 위해.
  • L2-노름 보장에서의 열등한 변환 방식을 개선하여, L0-노름 공격 하에서 상위-k 예측에 대해 날카로운 확률적 인증된 강건성 보장을 제공하는 방법을 개발하기 위해.
  • CIFAR10 및 ImageNet과 같은 대규모 데이터셋에서의 확장성과 효과성을 입증하기 위해, 3D 딥러닝 작업에도 적용 가능하도록 하기 위해.

제안 방법

  • 입력의 특징을 노이즈를 추가하는 대신 부분적으로 추출하는 랜덤화 스무딩의 한 형태인 랜덤화 제거를 사용하여 스무딩 분류기를 구축한다.
  • 다수의 제거된 입력에 대해 기본 분류기의 예측 확률을 기반으로 상위-k 레이블을 출력하는 스무딩 분류기를 구성한다.
  • 특징의 변형에 따른 레이블 예측 확률 분포를 분석하여 거의 날카로운 L0-노름 인증된 강건성 보장을 유도한다.
  • 이산 공간 내에서 확률적 경계와 영역 분할을 활용하여, 특정 L0-노름 반경 이내의 변형에서도 레이블이 상위-k 예측에 유지됨을 증명한다.
  • 이미지 분류, 3D 포인트 클라우드 분류(예: ModelNet40)에 적용하여 일반화 능력을 검증하기 위해 PointNet을 기본 분류기로 사용한다.
  • 이산 공간 내 엄격한 영역 제약 조건을 완화하여 비연속적 분할 문제를 해결하고, 날카로운 보장을 입증할 수 있도록 한다.

실험 결과

연구 질문

  • RQ1L0-노름 악성 공격에 대해 상위-k 예측에 대해 날카로운 인증된 강건성 보장을 달성할 수 있는가?
  • RQ2기존의 상위-1 예측만 인증하거나 L2-노름 경계를 사용하는 방법과 비교해, 상위-k 예측의 인증된 강건성은 어떻게 다른가?
  • RQ3랜덤화 제거는 강건성 보장이 강화된 상태에서 상위-k 출력 예측을 효과적으로 확장할 수 있는가?
  • RQ4실제 L0-변형 설정 하에서 ImageNet 및 ModelNet40와 같은 대규모 벤치마크에서 제안된 방법의 경험적 성능은 어떠한가?
  • RQ5이 방법은 다양한 아키텍처와 데이터 모odalities(예: 3D 포인트 클라우드)에 대해 어떻게 확장되고 일반화되는가?

주요 결과

  • 공격자가 테스트 이미지의 최대 5픽셀을 변형시킬 수 있을 때, ImageNet에서 상위-3 정확도가 69.2%에 도달한다.
  • CIFAR10에서 공격자가 1에서 5픽셀을 변형시킬 경우 각각 상위-1 정확도가 74.6%, 71.8%, 69.0%, 66.0%, 63.6%를 기록하며 이는 이전 연구를 능가한다.
  • ModelNet40에서 3D 포인트 클라우드 분류 작업을 수행한 결과, 10개의 포인트가 변형되었을 때 상위-3 정확도가 90.1%였고, 50개의 포인트가 변형되었을 땐 77.5%로 감소한다.
  • 최신 기술 수준의 상위-1 L0-강건성 방법인 Chiang 등(2020)에 비해 상당히 뛰어나며, 높은 공격 수준에서 인증 정확도가 두 배 이상 높다.
  • 이론적 분석을 통해 상위-k 예측에 대해 거의 날카로운 L0-노름 인증된 강건성 보장을 확립하였으며, 엄격한 이산 영역 제약 조건을 완화함으로써 날카로운 보장을 입증하는 전략을 수립하였다.
  • 이 방법은 이미지 외의 분야에도 일반화 가능하며, PointNet을 기본 분류기로 사용하여 3D 딥러닝 작업에서 뛰어난 성능을 보였다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.