Skip to main content
QUICK REVIEW

[논문 리뷰] GeoDA: a geometric framework for black-box adversarial attacks

Ali Rahmati, Seyed-Mohsen Moosavi-Dezfooli|arXiv (Cornell University)|2020. 03. 13.
Adversarial Robustness in Machine Learning참고 문헌 32인용 수 7
한 줄 요약

GeoDA는 깊이 신경망의 결정 경계의 낮은 평균 곡률을 이용하여 소수의 쿼리로 정규 벡터를 추정함으로써 쿼리 효율적인 블랙박스 적대적 공격을 위한 기하학적 프레임워크를 제안한다. ℓp-편차(≥1)를 최소화함으로써 최신 기술 수준의 성능을 달성하며, 이론적으로 최소 ℓ2-편차로 수렴하고 반복 과정에서 쿼리 분포를 최적화한다.

ABSTRACT

Adversarial examples are known as carefully perturbed images fooling image classifiers. We propose a geometric framework to generate adversarial examples in one of the most challenging black-box settings where the adversary can only generate a small number of queries, each of them returning the top-$1$ label of the classifier. Our framework is based on the observation that the decision boundary of deep networks usually has a small mean curvature in the vicinity of data samples. We propose an effective iterative algorithm to generate query-efficient black-box perturbations with small $\ell_p$ norms for $p \ge 1$, which is confirmed via experimental evaluations on state-of-the-art natural image classifiers. Moreover, for $p=2$, we theoretically show that our algorithm actually converges to the minimal $\ell_2$-perturbation when the curvature of the decision boundary is bounded. We also obtain the optimal distribution of the queries over the iterations of the algorithm. Finally, experimental results confirm that our principled black-box attack algorithm performs better than state-of-the-art algorithms as it generates smaller perturbations with a reduced number of queries.

연구 동기 및 목표

  • 단일 상위-1 레이블만 접근 가능한 가장 현실적인 블랙박스 설정에서 적대적 예제를 생성하는 데 도전한다.
  • 실제 도입에 있어 핵심적 장애물인 효과적인 적대적 편차를 생성하기 위해 필요한 쿼리 수를 줄인다.
  • 데이터 포인트 근처에서 결정 경계의 곡률이 낮다는 기하학적 성질을 활용하여 쿼리 효율성을 향상시킨다.
  • 특히 ℓ2에 대해 수렴 보장을 갖는, 수학적으로 탄탄한 ℓp-노름 적대적 공격 방법(≥1)을 개발한다.
  • 전이 가능성 및 부분공간 제약과 같은 사전 정보를 통합하여 공격 효율성과 정확도를 더욱 향상시킨다.

제안 방법

  • 결정 경계 근처의 점들 주변에 가우시안 편차를 사용하여 소수의 쿼리로 결정 경계의 정규 벡터를 추정한다.
  • 데이터 샘플 근처에서 결정 경계의 평균 곡률이 작다는 관찰에 기반해 결정 경계의 선형화를 수행한다.
  • 추정된 정규 방향을 따라 결정 경계 쪽으로 이동함으로써 점진적으로 편차 노름을 줄이는 반복적 공격 전략을 제안한다.
  • 기대 편차 노름을 최소화하는 이론적 경계를 사용하여 반복 과정에서 쿼리 분포를 최적화한다.
  • 전이 가능성(예: 서rogate 모델에서의 전이성)이나 DCT 부분공간 제약과 같은 사전 지식을 통합하여 정규 벡터 추정을 더 정확한 방향으로 편향시킨다.
  • ℓ2 공격의 경우, 곡률이 유계일 때 최소 편차로 수렴함을 증명하여 방법의 최적성에 대한 이론적 근거를 제공한다.

실험 결과

연구 질문

  • RQ1깊이 신경망의 결정 경계에서 낮은 곡률이라는 기하학적 성질을 활용하여 블랙박스 공격의 쿼리 복잡도를 줄일 수 있는가?
  • RQ2상위-1 레이블 피드백만을 사용할 때 결정 경계의 정규 벡터를 어떻게 효율적으로 추정할 수 있는가?
  • RQ3반복적 블랙박스 공격에서 편차 노름을 최소화하기 위해 쿼리를 반복 과정에 어떻게 최적 배분할 수 있는가?
  • RQ4전이 가능성 또는 부분공간 제약과 같은 사전 정보가 정규 벡터 추정의 정확도를 향상시키고 쿼리 수를 줄일 수 있는가?
  • RQ5제안된 방법은 곡률이 유계라는 가정 하에 최소 ℓ2-편차로 수렴하는가?

주요 결과

  • 하위공간 제약을 사용할 경우, 전체 공간 탐색 대비 GeoDA는 ℓ2-편차 노름을 약 27% 감소시킨다.
  • Boundary Attack 및 HopSkipJump Attack과 같은 최신 기술 대비 더 적은 쿼리로도 뛰어난 성능을 달성한다.
  • 이론적 분석 결과, ℓ2-편차의 경우 결정 경계 곡률이 유계일 때 GeoDA는 최소 편차로 수렴함을 보여준다.
  • 수학적 경계를 통해 유도된 최적의 쿼리 분포는 균일 분포나 단일 반복 전략보다 더 우수한 성능을 낸다.
  • 전이 가능성 또는 DCT 하위공간 사전 지식을 통합하면 정규 벡터 추정이 크게 향상되어 필요한 쿼리 수가 감소한다.
  • 가우시안 편차 분산 σ의 선택은 오분류와 경계점 정확도 사이의 균형을 이루어야 하며, 최적 성능은 중간 값에서 달성된다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.