[논문 리뷰] On the Design of Black-box Adversarial Examples by Leveraging Gradient-free Optimization and Operator Splitting Method
이 논문은 제로번째 순서(Zeroth-order, ZO) 최적화와 베이지안 최적화(BO)를 ADMM와 결합한 일반적인 블랙박스 적대적 공격 프레임워크를 제안한다. 이는 다양한 왜곡 메트릭과 위협 모델에서 효율적이고 강력한 공격을 가능하게 하며, MNIST, CIFAR-10, ImageNet에서 높은 공격 성공률을 유지하면서도 최대 99.2%까지 쿼리 수를 감소시켜 최신 기술 수준의 쿼리 효율성을 달성한다.
Robust machine learning is currently one of the most prominent topics which could potentially help shaping a future of advanced AI platforms that not only perform well in average cases but also in worst cases or adverse situations. Despite the long-term vision, however, existing studies on black-box adversarial attacks are still restricted to very specific settings of threat models (e.g., single distortion metric and restrictive assumption on target model's feedback to queries) and/or suffer from prohibitively high query complexity. To push for further advances in this field, we introduce a general framework based on an operator splitting method, the alternating direction method of multipliers (ADMM) to devise efficient, robust black-box attacks that work with various distortion metrics and feedback settings without incurring high query complexity. Due to the black-box nature of the threat model, the proposed ADMM solution framework is integrated with zeroth-order (ZO) optimization and Bayesian optimization (BO), and thus is applicable to the gradient-free regime. This results in two new black-box adversarial attack generation methods, ZO-ADMM and BO-ADMM. Our empirical evaluations on image classification datasets show that our proposed approaches have much lower function query complexities compared to state-of-the-art attack methods, but achieve very competitive attack success rates.
연구 동기 및 목표
- 기존의 블랙박스 적대적 공격에서 높은 쿼리 복잡도 문제를 해결하며, 특히 쿼리 제한 또는 실세계 환경에서의 적용을 고려한다.
- 이전 방법들이 특정 왜곡 메트릭(예: ℓ₂ 또는 ℓ∞)이나 위협 모델(예: 점수 기반 공격에 국한)에 국한되어 있음을 극복한다.
- 다양한 ℓp-노름 왜곡 메트릭과 점수 기반 및 결정 기반 위협 모델을 모두 지원하는 통합적이고 유연한 프레임워크를 개발한다.
- 공격 성공률을 희생시키지 않은 채 쿼리 효율성을 향상시켜 실세계 머신러닝 시스템에서의 실용적 구현을 가능하게 한다.
- 모델 기울기가 이용 불가능한 기울기 없음(gradient-free) 환경에서도 강력한 적대적 공격 생성을 가능하게 한다.
제안 방법
- 제약 최적화를 위한 1차 연속 방법인 분할 증분 다중승수 방법(ADMM, alternating direction method of multipliers) 기반의 일반적인 적대적 공격 프레임워크를 제안한다.
- ADMM에 제로번째 순서(ZO) 최적화를 통합하여 기울기 없이 공격를 생성할 수 있도록 하며, 효율적인 함수 쿼리 활용을 위해 무작위 기울기 추정(RGE)을 사용한다.
- 점수 기반 공격를 위한 ZO-ADMM와 결정 기반 공격를 위한 BO-ADMM를 개발하며, 베이지안 최적화를 통해 쿼리 효율성을 향상시킨다.
- 임의의 ℓp-노름 볼 제약(예: ℓ₀, ℓ₁, ℓ₂)과 그 선형 조합을 지원하도록 프레임워크를 일반화하여 왜곡 제어의 유연성을 확보한다.
- ADMM 공식화를 소프트 레이블(점수 기반) 및 하드 레이블(결정 기반) 피드백을 모두 처리할 수 있도록 적응시킨다.
- 반복 업데이트를 통해 저비용의 각 반복 계산으로 풀 수 있는 하위 문제로 분해할 수 있도록 증강 라그랑주 형식을 사용한다.
실험 결과
연구 질문
- RQ1기울기 없음 조건 하에서 제약을 받는 블랙박스 적대적 공격 생성에 ADMM 기반 최적화가 효과적으로 적용될 수 있는가?
- RQ2제안된 ZO-ADMM 프레임워크는 최신 기술 수준의 ZOO 및 경계 기반 공격 대비 쿼리 효율성과 공격 성공률에서 어떻게 비교되는가?
- RQ3최적화 과정을 재설계하지 않고도 다양한 ℓp-노름 왜곡 메트릭으로 프레임워크가 얼마나 잘 일반화되는가?
- RQ4결정 기반 블랙박스 공격 환경에서 베이지안 최적화(BO) 통합이 추가로 쿼리 복잡도를 감소시킬 수 있는가?
- RQ5점수 기반 및 결정 기반 피드백을 모두 포함한 다양한 위협 모델에서 프레임워크는 얼마나 강력한가?
주요 결과
- ImageNet에서 ZO-ADMM는 ZOO 공격 대비 초기 성공을 달성하기 위해 필요한 쿼리 수를 비타겟팅 공격 시 94.3%, 타겟팅 공격 시 99.2% 감소시켰다.
- MNIST 및 CIFAR-10에서 ZO-ADMM는 1,000 쿼리 이내로 성공적인 공격를 달성하여 기준 기법들을 크게 능가했다.
- ℓ₂ 왜곡의 경우 ZO-ADMM는 평균 ℓ₂ 왜곡이 1.93에 불과할 정도로 100%의 공격 성공률를 달성했으며, ZOO보다 효율성과 왜곡 제어 면에서 뛰어났다.
- 프레임워크는 ℓ₀ 및 ℓ₁ 노름으로도 성공적으로 일반화되었으며, 각각 평균 ℓ₀ 왜곡 18.5, ℓ₁ 왜곡 10.5로 100%의 공격 성공률를 달성했다.
- 결정 기반 환경에서는 레이블 전용 공격보다 훨씬 적은 쿼리로 높은 공격 성공률를 달성했으며, 일부 경우 ZOO 공격보다도 뛰어난 성능을 보였다.
- 수렴 분석 결과, ZO-ADMM는 데이터셋의 복잡성에 따라 수백에서 수만 개의 쿼리 이후 낮은 왜곡 수준에서 안정화됨을 확인했다.
더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.