Skip to main content
QUICK REVIEW

[논문 리뷰] RayS: A Ray Searching Method for Hard-label Adversarial Attack

Jinghui Chen, Quanquan Gu|arXiv (Cornell University)|2020. 06. 23.
Adversarial Robustness in Machine Learning참고 문헌 41인용 수 7
한 줄 요약

RayS는 연속적인 결정 경계 탐색을 이산 문제로 재구성함으로써 제로계층 기울기 추정이 필요 없도록 하는 새로운 하드 레이블 적대적 공격 방법이다. 무효 탐색을 정리하기 위한 빠른 점검 단계를 사용함으로써, 특히 $L_{\infty}$ 노름 위협 모델 하에서 이전의 하드 레이블 공격보다 공격 성공률이 높고 쿼리 복잡도가 낮아, 표준 백박스 및 블랙박스 공격을 피하는 '거짓으로 강건한' 모델을 드러낸다.

ABSTRACT

Deep neural networks are vulnerable to adversarial attacks. Among different attack settings, the most challenging yet the most practical one is the hard-label setting where the attacker only has access to the hard-label output (prediction label) of the target model. Previous attempts are neither effective enough in terms of attack success rate nor efficient enough in terms of query complexity under the widely used $L_\infty$ norm threat model. In this paper, we present the Ray Searching attack (RayS), which greatly improves the hard-label attack effectiveness as well as efficiency. Unlike previous works, we reformulate the continuous problem of finding the closest decision boundary into a discrete problem that does not require any zeroth-order gradient estimation. In the meantime, all unnecessary searches are eliminated via a fast check step. This significantly reduces the number of queries needed for our hard-label attack. Moreover, interestingly, we found that the proposed RayS attack can also be used as a sanity check for possible "falsely robust" models. On several recently proposed defenses that claim to achieve the state-of-the-art robust accuracy, our attack method demonstrates that the current white-box/black-box attacks could still give a false sense of security and the robust accuracy drop between the most popular PGD attack and RayS attack could be as large as $28\%$. We believe that our proposed RayS attack could help identify falsely robust models that beat most white-box/black-box attacks.

연구 동기 및 목표

  • 널리 사용되는 $L_{\\text{\textbackslash{}infty}}$ 노름 위협 모델 하에서 효과적이고 효율적인 하드 레이블 적대적 공격을 해결한다.
  • 이전의 하드 레이블 공격은 제로계층 기울기 추정이나 열악한 탐색 전략에 의존함으로써 효율적이거나 효과적이지 않다는 한계를 극복한다.
  • 표준 백박스 및 블랙박스 공격을 피하는 거짓 강건성을 드러내는 방법을 개발함으로써 강건 모델의 사전 검증을 가능하게 한다.
  • 빠른 점검 메커니즘을 통해 불필요한 탐색을 제거함으로써 쿼리 효율성을 향상시킨다.
  • 현재 높은 강건 정확도를 주장하는 방어 기법이 RayS와 같은 더 정교한 하드 레이블 공격에 여전히 취약할 수 있음을 입증한다.

제안 방법

  • 실제 $L_{\\text{\textbackslash{}infty}}$ 노름 설정에서의 관찰 결과를 바탕으로, 가장 가까운 결정 경계를 찾는 연속 문제를 이산 탐색 문제로 재구성한다.
  • 결정 경계 반경을 주요 탐색 기준으로 사용하며, 이는 오차 분류와의 가까움을 직접 측정한다.
  • 후보 변형이 결정 경계 위에 있는지 신속하게 검증하는 빠른 점검 단계를 도입하여 비효율적 탐색 경로를 잘라낸다.
  • 원본 입력에서부터 이산 방향을 따라 레이 기반 탐색을 수행하여 변형 공간을 효율적으로 탐색한다.
  • 단지 하드 레이블 피드백(클래스 예측)을 기반으로 하여 제로계층 기울기 추정을 완전히 회피한다.
  • 탐색의 이산성 특성을 활용하여 쿼리 복잡도를 감소시키면서도 높은 공격 성공률을 유지한다.

실험 결과

연구 질문

  • RQ1제로계층 기울기 추정에 의존하지 않고도 $L_{\\text{\textbackslash{}infty}}$ 노름 위협 모델 하에서 매우 효과적이고 효율적인 하드 레이블 공격을 설계할 수 있는가?
  • RQ2제안된 RayS 방법은 SignOPT, HSJA, RayS와 같은 기존 하드 레이블 공격과 비교해 쿼리 효율성과 공격 성공률 측면에서 어떻게 다른가?
  • RQ3RayS는 표준 백박스 및 블랙박스 공격 하에서 강건해 보이지만 실제로는 더 정교한 하드 레이블 공격에 취약한 모델을 어느 정도 드러낼 수 있는가?
  • RQ4기존의 손실 함수인 CrossEntropy나 CW 손실은 결정 경계 근처의 중간 적대적 예제의 진정한 잠재력을 정확히 반영하지 못하는 이유는 무엇인가?
  • RQ5하드 레이블 공격 설정에서, 서로서의 손실 함수보다 결정 경계 반경이 더 신뢰할 수 있는 탐색 기준이 될 수 있는가?

주요 결과

  • RayS는 WideResNet 모델에 대해 적대적 보간 훈련 하에서 CIFAR-10, $\epsilon=0.031$ 조건에서 상태 최고의 공격 성공률 44.5%를 기록했으며, ADBD는 0.030이었다. 이는 SignOPT(87.1% 강건 정확도)와 HSJA(70.0% 강건 정확도)를 크게 능가한다.
  • 적대적 훈련을 통해 방어된 모델의 강건 정확도는 RayS 공격 시 PGD 공격 대비 최대 28% 감소하였으며, 이는 심각한 거짓 강건성을 드러낸다.
  • 동일한 CIFAR-10 데이터셋에서 RayS는 또 다른 강건 모델(적대적 보간 훈련)의 강건 정확도를 46.9%로 낮추었으며, 이는 HSJA의 70.5%와 SignOPT의 84.2%보다 뛰어난 효과를 보였다.
  • 빠른 점검 단계를 통해 불필요한 탐색을 제거함으로써 RayS는 이전의 하드 레이블 공격보다 쿼리 복잡도를 감소시켰다.
  • RayS는 PGD 및 기타 백박스/블랙박스 공격 하에서 높은 강건 정확도를 유지하지만 RayS 공격에 실패하는 '거짓으로 강건한' 모델을 성공적으로 탐지하여 현재 방어 기법의 거짓된 안정감을 드러냈다.
  • 결정 경계 반경은 CrossEntropy나 CW 손실과 같은 서로서의 손실 함수보다 더 신뢰할 수 있는 탐색 기준임을 입증하였으며, 이는 동일한 손실 값이 매우 다른 적대적 잠재력을 가진 예제들 사이에서 탐색을 오도할 수 있기 때문이다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.