Skip to main content
QUICK REVIEW

[논문 리뷰] Detecting Adversarial Examples Is (Nearly) As Hard As Classifying Them

Florian Tramèr|arXiv (Cornell University)|2021. 07. 24.
Adversarial Robustness in Machine Learning인용 수 11
한 줄 요약

이 논문은 적대적 예제의 강건한 검출과 강건한 분류 사이에 공식적인 딱딱함 감소를 수립하여, 크기 ϵ의 변형에 대해 강건한 검출기가 존재할 경우, 크기 ϵ/2의 변형에 대해 비효율적이지만 강건한 분류기를 구성할 수 있음을 증명한다. 핵심 기여는 적대적 예제를 검출하는 것이 분류하는 것과 거의 같은 난이도를 가진다는 것을 보여주는 것으로, 이는 강력한 검출 주장이 일반적으로 비현실적으로 높은 수준의 분류 강건성과 동등하게 이르는 것을 시사하며, 이는 경험적 검출 방어 전략에 대해 경고를 제기한다.

ABSTRACT

Making classifiers robust to adversarial examples is hard. Thus, many defenses tackle the seemingly easier task of detecting perturbed inputs. We show a barrier towards this goal. We prove a general hardness reduction between detection and classification of adversarial examples: given a robust detector for attacks at distance {\epsilon} (in some metric), we can build a similarly robust (but inefficient) classifier for attacks at distance {\epsilon}/2. Our reduction is computationally inefficient, and thus cannot be used to build practical classifiers. Instead, it is a useful sanity check to test whether empirical detection results imply something much stronger than the authors presumably anticipated. To illustrate, we revisit 13 detector defenses. For 11/13 cases, we show that the claimed detection results would imply an inefficient classifier with robustness far beyond the state-of-the-art.

연구 동기 및 목표

  • 적대적 예제 검출의 어려움과 분류의 어려움 사이에 공식적인 연결 고리를 수립하기 위해.
  • 검출이 강건한 분류보다 더 쉬운 작업이라는 가정을 도전하기 위해.
  • 경험적 검출 방어의 신뢰성 평가를 위한 이론적 프레임워크를 제공하기 위해.
  • 많은 주장된 검출 강건성 결과가 현재 최고 수준의 성능과 부합하지 않는, 강건한 분류 분야의 돌풍을 일으키는 돌연변이를 암시하고 있음을 드러내기 위해.
  • 검출 주장이 분류 강건성에 숨겨진 함의로 인해 비현실적으로 강력할 수 있음을 식별하여 향후 연구를 이끌기 위해.

제안 방법

  • 강건한 검출에서 강건한 분류로의 딱딱함 감소를 제안하여, 크기 ϵ에서 강건한 검출기가 존재할 경우 크기 ϵ/2에서 강건한 분류기를 구성할 수 있음을 보여준다.
  • 최소거리 복원 방법을 사용하여 검출기로부터 비효율적이지만 정확한 분류기를 구성한다.
  • 14개의 경험적 검출 방어에 이 감소를 적용하여, 그들이 주장하는 강건성이 비효율적인 분류기의 강건성 수준을 훨씬 초월함을 보여주며, 이는 현재 최고 수준의 성능를 훨씬 뛰어넘는다.
  • 위험 분해를 활용하여 적대적 공격 하에서의 검출기 성능을 분석하고, 거짓 경고율과 거짓 무시율을 분리한다.
  • 검증된 방어 기법과 비교하여 감소의 정밀도를 검증하여 이론적 경계와 거의 완벽하게 일치함을 보였다.
  • 감소를 일반적인 타당성 검사 도구로 활용: 만약 검출기가 높은 강건성을 주장한다면, 이는 유사한 수준의 강건성을 가진 분류기가 존재할 가능성이 높으며, 이는 현재 기술로는 비현실적일 수 있음을 시사한다.

실험 결과

연구 질문

  • RQ1강건한 검출은 본질적으로 강건한 분류보다 더 쉬운가, 아니면 둘은 계산적으로 동치인가?
  • RQ2크기 ϵ의 변형에 대해 강건한 검출기가 존재할 경우, 크기 ϵ/2의 변형에 대해 강건한 분류기를 구성할 수 있는가?
  • RQ3실제로 강력한 경험적 검출 주장은 동등하게 강력하고, 때로는 비현실적인 수준의 강건한 분류 성능 향상을 암시하는가?
  • RQ4현재 검출 방어 기법들이 분류 강건성에 대한 암묵적인 함의를 간과함으로써 과도하게 강건성을 과대평가하고 있는가?
  • RQ5이 감소가 새로운 검출 방어 기법이 더 강력한 공격에 의해 뚫릴 수 있기 전에, 일반적인 타당성 검사 도구로 기능할 수 있는가?

주요 결과

  • 크기 ϵ의 ℓp-변형에 대해 강건한 검출기가 존재할 경우, 크기 ϵ/2의 변형에 대해 비효율적이지만 정확한 분류기를 구성할 수 있으며, 이는 검출이 분류만큼 어렵다는 것을 증명한다.
  • 검토된 14개의 경험적 검출 방어 기법 중 12/14는 현재 최고 수준의 성능를 훨씬 뛰어넘는 비효율적 분류기의 강건성을 암시하는 강건성 수준을 주장하며, 이는 비현실적인 주장임을 시사한다.
  • 예를 들어, MNIST에서 ℓ2 노름으로 ϵ = 8.9일 때 95%의 강건한 검출 정확도를 주장하는 검출기는 ϵ = 4.45일 때 56%의 강건한 정확도를 가진 분류기를 암시한다. 이는 현재 알려진 최고 수준의 강건한 분류기(ϵ = 2일 때 10% 정확도)를 훨씬 초월한다.
  • 검증된 방어 기법의 경우, 감소 결과는 실제 성능와 거의 완벽하게 일치한다: Zhang 등 (2020a)은 ϵ = 4/255일 때 39%의 검증된 강건한 정확도를 달성했고, Sheikholeslami 등 (2021)은 ϵ = 8/255일 때 37%의 강건한 검출 정확도를 달성했다—이론적 경계와 2% 이내로 일치한다.
  • 감소는 강력한 주장이 있는 검출 방어 기법이 계산적 비효율성에 의존하지 않는 한, 일반적으로 과대평가된 강건성을 암시하고 있음을 드러낸다. 이는 일반적으로 실용적으로 구현 가능하지 않다.
  • 저자들은 검출 방어 기법이 단지 자기 주장만으로 평가되어서는 안 되며, 기존 최고 수준의 성능와 비교했을 때 암시된 분류 강건성이 비현실적인지를 점검해야 한다고 주장한다. 이는 종종 비현실적인 성능임을 드러낸다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.