[논문 리뷰] QEBA: Query-Efficient Boundary-Based Blackbox Attack
QEBA는 입력 공간의 저차원 부분공간(공간, 주파수, 내재 성분)에 대한 최적화를 통해 왜곡을 투영함으로써 쿼리 복잡도를 감소시키는 쿼리 효율적인 경계 기반 블랙박스 공격을 제안한다. 이는 빠른 수렴과 더 작은 왜곡 크기를 가능하게 하며, ImageNet, CelebA 및 MEGVII Face++ 및 Microsoft Azure와 같은 실제 웹 API에서 최신 기술 대비 훨씬 적은 쿼리로 100% 공격 성공률를 달성한다.
Machine learning (ML), especially deep neural networks (DNNs) have been widely used in various applications, including several safety-critical ones (e.g. autonomous driving). As a result, recent research about adversarial examples has raised great concerns. Such adversarial attacks can be achieved by adding a small magnitude of perturbation to the input to mislead model prediction. While several whitebox attacks have demonstrated their effectiveness, which assume that the attackers have full access to the machine learning models; blackbox attacks are more realistic in practice. In this paper, we propose a Query-Efficient Boundary-based blackbox Attack (QEBA) based only on model's final prediction labels. We theoretically show why previous boundary-based attack with gradient estimation on the whole gradient space is not efficient in terms of query numbers, and provide optimality analysis for our dimension reduction-based gradient estimation. On the other hand, we conducted extensive experiments on ImageNet and CelebA datasets to evaluate QEBA. We show that compared with the state-of-the-art blackbox attacks, QEBA is able to use a smaller number of queries to achieve a lower magnitude of perturbation with 100% attack success rate. We also show case studies of attacks on real-world APIs including MEGVII Face++ and Microsoft Azure.
연구 동기 및 목표
- 고차원 입력 공간에서 기반하는 기울기 추정에 의존하는 경계 기반 블랙박스 공격의 높은 쿼리 비용을 해결한다.
- 성공적인 대비 공격를 위해 필요한 모델 쿼리 수를 줄이되, 100% 공격 성공률를 유지한다.
- 최종 모델 예측 레이블만을 사용하는 일반화 가능한 프레임워크를 개발하여 실제 웹 API에 실용적으로 적용 가능하게 한다.
- 전체 입력 공간 대신 대표적인 저차원 부분공간에 집중하여 기울기 추정을 최적화한다.
- 오프라인 벤치마크(ImageNet, CelebA)와 실제 상용 웹 API 모두에서의 효과성을 입증한다.
제안 방법
- 공간(선형 보간을 통한), 주파수(DCT를 이용한 저주파수 샘플링), 내재(PCA 기반 기울기 행렬 분해)를 활용한 세 가지 새로운 부분공간 최적화 방법을 제안한다.
- 각 새로운 대비 샘플을 결정 경계에 투영하기 위해 이진 탐색을 사용하여 오분류 상태를 유지한다.
- 감소된 부분공간 내에서 기울기를 추정하여, 목표 이미지로의 이동을 안내하면서 쿼리 사용을 최소화한다.
- 공격은 반복적으로 저차원 부분공간에서 왜곡을 생성하고, 원래 공간으로 투영한 후 쿼리를 통해 모델 예측을 확인한다.
- 이론적 분석을 통해 최적화된 부분공간에서의 기울기 추정이 전체 공간 추정보다 최적임을 증명한다.
- 이미지 데이터의 구조적 특성(공간 일관성, 주파수 성분, 주요 성분)을 활용하여 공격 품질을 훼손하지 않으면서 차원을 감소시킨다.
실험 결과
연구 질문
- RQ1입력 공간에서의 차원 축소가 경계 기반 블랙박스 공격의 쿼리 효율성 향상에 기여하는가?
- RQ2공간, 주파수, 내재 부분공간은 쿼리 효율성과 왜곡 품질 측면에서 어떻게 비교되는가?
- RQ3감소된 부분공간에서의 기울기 추정이 전체 공간 기울기 추정보다 이론적으로 최적인가?
- RQ4제안된 방법은 기존의 블랙박스 공격 대비 실제 웹 API에서 더 적은 쿼리로 높은 공격 성공률를 달성할 수 있는가?
- RQ5부분공간 선택이 다양한 데이터셋과 공격 목표에서 성능에 미치는 영향은 어떠한가?
주요 결과
- QEBA는 ImageNet과 CelebA에서 최신 기술 대비 최대 50%까지 쿼리 수를 감소시키며 100% 공격 성공률를 달성한다.
- MEGVII Face++ 'compare' API에서, QEBA가 생성한 대비 샘플은 HJSA보다 더 매끄러운 왜곡과 더 낮은 MSE(목표 이미지와의 거리)를 보였으며, 6,000건 이상의 쿼리에도 불구하고 성능이 뛰어나다.
- Microsoft Azure 'detect' API에서는 QEBA가 얼굴 감지 기능을 회피할 수 있는 대비 이미지를 생성하였고, 왜곡은 미세하고 매끄럽게 유지되어 가짜 고양이 귀 같은 잡음 요소를 피했다.
- 제안된 부분공간 기반 기울기 추정은 이론적으로 최적이며, 쿼리 효율성 측면에서 전체 공간 기울기 추정을 능가한다.
- 사례 연구를 통해 QEBA는 합리적인 크기의 왜곡과 높은 시각적 정확도를 유지하면서도 실제 상용 웹 API를 성공적으로 공격할 수 있었다.
- QEBA의 성능는 데이터셋 크기, 모델의 매끄러움, 공격 목표에 따라 부분공간에 따라 달라지며, 내재(PCA 기반) 및 주파수 부분공간에서 뛰어난 성능를 보였다.
더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.