Skip to main content
QUICK REVIEW

[논문 리뷰] Can Adversarially Robust Learning Leverage Computational Hardness?

Saeed Mahloujifar, Mohammad Mahmoody|arXiv (Cornell University)|2018. 10. 02.
Adversarial Robustness in Machine Learning인용 수 13
한 줄 요약

이 논문은 제품 분포에서 샘플링된 분류기의 적대적 강건성 학습이 계산적 난이도에 기반할 수 없음을 보여준다. 고차원 제품 공간에서의 계산적 측도 집중 현상을 이용하여, 초기 오차가 상수일지라도 다항시간의 회피 및 오염 공격이 $O(\tilde{\rho}(\text{poly}(n))$의 변형만으로도 적대적 예제를 생성할 수 있음을 증명한다.

ABSTRACT

Making learners robust to adversarial perturbation at test time (i.e., evasion attacks) or training time (i.e., poisoning attacks) has emerged as a challenging task. It is known that for some natural settings, sublinear perturbations in the training phase or the testing phase can drastically decrease the quality of the predictions. These negative results, however, are information theoretic and only prove the existence of such successful adversarial perturbations. A natural question for these settings is whether or not we can make classifiers computationally robust to polynomial-time attacks. In this work, we prove strong barriers against achieving such envisioned computational robustness both for evasion and poisoning attacks. In particular, we show that if the test instances come from a product distribution (e.g., uniform over $\{0,1\}^n$ or $[0,1]^n$, or isotropic $n$-variate Gaussian) and that there is an initial constant error, then there exists a polynomial-time attack that finds adversarial examples of Hamming distance $O(\sqrt n)$. For poisoning attacks, we prove that for any learning algorithm with sample complexity $m$ and any efficiently computable "predicate" defining some "bad" property $B$ for the produced hypothesis (e.g., failing on a particular test) that happens with an initial constant probability, there exist polynomial-time online poisoning attacks that tamper with $O (\sqrt m)$ many examples, replace them with other correctly labeled examples, and increases the probability of the bad event $B$ to $\approx 1$. Both of our poisoning and evasion attacks are black-box in how they access their corresponding components of the system (i.e., the hypothesis, the concept, and the learning algorithm) and make no further assumptions about the classifier or the learning algorithm producing the classifier.

연구 동기 및 목표

  • 회피 및 오염 공격 환경에서 계산적 난이도가 적대적 강건성 학습의 기초가 될 수 있는지 조사하기 위해.
  • 다항시간 공격자가 제품 분포의 구조적 특성을 이용해 최소한의 변형으로 효과적인 적대적 예제를 생성할 수 있는지 결정하기 위해.
  • 제품 공간에 대한 고전적 측도 집중 정리의 계산적 대응을 수립하여 효율적인 공격 구축을 가능하게 하기 위해.
  • 초기 오차가 상수일 때의 강건성의 한계를 분석하여, 조그만 취약성이라도 효율적인 공격에 의해 확대될 수 있음을 보여주기 위해.

제안 방법

  • 제품 분포에서의 계산적 측도 집중 현상을 활용하여, [KKR18]의 결과에 영감을 받아 효율적인 블랙박스 공격을 구축한다.
  • 동전 뒤집기 기반 알고리즘 증명을 사용하여 랜덤 포인트를 측도가 높은 집합으로 효율적으로 매핑하며, 제품 공간의 기하학적 특성을 활용한다.
  • 가설 공간 내의 근사 멤버십 및 샘플링 오라클을 사용하여 학습 알고리즘과 분류기의 블랙박스 액세스를 가능하게 한다.
  • 확률 이론의 경계(예: 체르노프 유사 부등식 및 尾부 경계)를 적용하여 공격의 오차와 성공 확률을 제어한다.
  • 측도 집중 불등식과 오라클 복잡도를 사용하여 실행 시간 경계를 유도하며, 약간의 가정 하에 공격이 $O(n^{12} \times \text{polylog}(n))$ 시간 내에 실행됨을 보여준다.
  • 임의의 측도 $\mu = \omega(\log n / \sqrt{n})$를 갖는 집합 $\mathcal{S}$에 대해, 다항시간 알고리즘이 대부분의 점들을 $O(\sqrt{n})$ 히프닝 거리 내에 $\mathcal{S}$로 매핑할 수 있음을 증명한다.

실험 결과

연구 질문

  • RQ1회피 공격에서, 학습의 적대적 강건성이 계산적 난이도 가정에 기반할 수 있는가?
  • RQ2초기 오차가 상수일지라도, 다항시간 오염 공격이 분류기의 실패 확률을 크게 증가시킬 수 있는가?
  • RQ3제품 공간에서의 계산적 측도 집중 현상을 얼마나 효율적인 블랙박스 공격 구축에 활용할 수 있는가?
  • RQ4계산적 측도 집중 현상이 비현실적인 하위선형 공격을 유도하기 위해 필요한 최소 초기 오차 확률 $\mu$는 얼마인가?
  • RQ5다른 거리 측도 공간(예: 등방성 가우시안)은 계산적으로 집중되어 있는가? 이는 유사한 공격을 가능하게 하는가?

주요 결과

  • 회피 공격의 경우, 다항시간 공격자가 초기 오차가 상수일지라도 어떤 테스트 인스턴스로부터 $O(\sqrt{n})$ 히프닝 거리 이내의 적대적 예제를 생성할 수 있다.
  • 오염 공격의 경우, 공격자는 오직 $O(\sqrt{m})$개의 학습 예제만 조작하여 특정 인스턴스에서의 오분류 확률을 상수에서 약 1로 증가시킬 수 있다.
  • 공격은 블랙박스이다: 분류기나 학습 과정에 대한 가정 없이, 가설, 학습 알고리즘, 멤버십 오라클에만 액세스할 수 있다.
  • 공격 알고리즘의 실행 시간은 $O(n^{12} \cdot \ell / (\mu \cdot (1 - \rho))^5)$ 이하로 제한되며, 여기서 $\ell$은 입력 길이이고 $\rho$는 원하는 성공 확률이다.
  • 약간의 가정 하에 결과가 성립한다: 인스턴스 공간은 제품 분포(예: $\{0,1\}^n$, $[0,1]^n$, 또는 등방성 가우시안)이며, 초기 오차는 부실하지 않다.
  • 논문은 고전적 측도 집중 현상의 계산적 대응을 수립하여, 효율적인 알고리즘이 제품 공간 내에서 측도가 큰 집합에 가까운 점을 찾을 수 있음을 보여준다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.