Skip to main content
QUICK REVIEW

[논문 리뷰] Sparse-RS: a versatile framework for query-efficient sparse black-box adversarial attacks

Francesco Croce, Maksym Andriushchenko|arXiv (Cornell University)|2020. 06. 23.
Adversarial Robustness in Machine Learning인용 수 10
한 줄 요약

Sparse-RS는 l₀-제약 편향, 적대적 패치 및 프레임에 대해 상태의 기술을 달성하는 쿼리 효율적이고 블랙박스인 적대적 공격 프레임워크로, 서로서이 모델이 필요하지 않다. MNIST, CIFAR-10 및 ImageNet에서 블랙박스 및 WHITELIST 공격을 모두 능가하며, 20×20 패치 및 2픽셀 폭 프레임과 같은 도전적인 환경에서도 높은 성공률을 기록한다.

ABSTRACT

We propose a versatile framework based on random search, Sparse-RS, for score-based sparse targeted and untargeted attacks in the black-box setting. Sparse-RS does not rely on substitute models and achieves state-of-the-art success rate and query efficiency for multiple sparse attack models: $l_0$-bounded perturbations, adversarial patches, and adversarial frames. The $l_0$-version of untargeted Sparse-RS outperforms all black-box and even all white-box attacks for different models on MNIST, CIFAR-10, and ImageNet. Moreover, our untargeted Sparse-RS achieves very high success rates even for the challenging settings of $20 imes20$ adversarial patches and $2$-pixel wide adversarial frames for $224 imes224$ images. Finally, we show that Sparse-RS can be applied to generate targeted universal adversarial patches where it significantly outperforms the existing approaches. The code of our framework is available at https://github.com/fra31/sparse-rs.

연구 동기 및 목표

  • l₀-편향, 적대적 패치 및 프레임과 같은 희박한 위협 모델에 대해 효율적이고 쿼리 효율적인 블랙박스 공격의 부족을 해결한다.
  • 기울기나 모델 가중치를 사용하지 않고 분류기 점수만을 기반으로 작동하는 프레임워크를 개발하여 실용적인 블랙박스 공격을 가능하게 한다.
  • 기존의 블랙박스 방법에 비해 성공률과 쿼리 효율성을 향상시키며, 특히 고차원적이고 조합 제약이 있는 환경에서 성능을 개선한다.
  • 기존 접근 방식보다 뛰어난 성능을 보이는 타겟팅 가능한 유니버설 적대적 패치 생성을 가능하게 한다.
  • 서브stitue 모델에 의존하지 않고 다양한 희박한 공격 유형에 적용 가능한 통합적이고 유연한 프레임워크를 제공한다.

제안 방법

  • 조합 제약 조건 하에 희박한 편향 공간을 탐색하기 위해 무작위 검색 기반의 제로스터드 최적화를 활용한다.
  • 높은 영향력을 가진 희박한 편향(예: 픽셀 위치 또는 패치 위치 효율적으로 선택)을 우선시하는 전용 샘플링 분포를 설계한다.
  • 두 단계 업데이트 전략을 도입: 위치 업데이트와 패치 업데이트를 1:4 비율로 번갈아 적용하여 수렴을 향상시킨다.
  • 초기 위치 수렴 후에 단일 채널 업데이트를 통해 패치 내용을 정밀하게 조정하여 성공률을 향상시킨다.
  • 정사각형 패치와 랜덤 샘플링을 조합한 하이브리드 초기화 전략을 적용하여 초기 탐색을 향상시키고 국소 최소값을 피한다.
  • 분류기 신뢰도 점수만 액세스하는 점수 기반 최적화를 적용하여 기울기 계산 없이도 완전한 블랙박스 운영을 가능하게 한다.

실험 결과

연구 질문

  • RQ1무작위 검색이 블랙박스 희박한 적대적 공격에서 높은 쿼리 효율성과 성공률을 달성하는 데 효과적으로 적응될 수 있는가?
  • RQ2Sparse-RS 프레임워크는 l₀-편향에 대해 기존의 블랙박스 및 화이트박스 공격과 비교해 성공률과 쿼리 비용 측면에서 어떻게 성과를 내는가?
  • RQ3Sparse-RS는 특히 물리 세계 환경에서 어려운 조건에서도 최소한의 쿼리로 고품질의 적대적 패치 및 프레임을 생성할 수 있는가?
  • RQ4Sparse-RS는 기존 방법보다 타겟팅 가능한 유니버설 적대적 패치 생성에서 뛰어난 성능을 보일 수 있는가?
  • RQ5위치와 패치 콘텐츠 간의 다양한 업데이트 비율은 공격의 성능 및 안정성에 어떤 영향을 미치는가?

주요 결과

  • Sparse-RS의 l₀-유니버설 버전은 MNIST, CIFAR-10 및 ImageNet에서 최신 기술 성과를 달성하며, 모든 이전의 블랙박스 공격뿐 아니라 화이트박스 공격까지도 능가한다.
  • ImageNet에서 20×20 적대적 패치에 대해 Sparse-RS는 ResNet 기준으로 단지 2,160 ± 44회의 중앙 쿼리로 87.8% ± 0.7%의 성공률을 기록한다.
  • 2픽셀 폭의 적대적 프레임에 대해 Sparse-RS는 2,808 ± 89회의 중앙 쿼리로 79.5% ± 1.4%의 성공률을 기록하며, 이는 이전 방법들을 크게 능가한다.
  • 최적화된 초기화 및 업데이트 전략을 갖춘 Sparse-RS의 변종인 Patch-RS는 20×20 패치에서 2,160회의 중앙 쿼리로 87.8%의 성공률을 기록하며, TPA 및 PGD 기반 기준선을 모두 초월한다.
  • 위치 업데이트 대 패치 업데이트 비율 1:4가 최고의 성능을 보이며, Patch-RS는 다양한 업데이트 비율에서도 높은 강건성을 유지하여 알고리즘의 안정성을 입증한다.
  • Sparse-RS는 기존 접근 방식보다 훨씬 높은 성공률로 타겟팅 가능한 유니버설 패치 공격을 가능하게 하여, 복잡한 공격 시나리오에서의 유연성과 효과성을 입증한다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.