Skip to main content
QUICK REVIEW

[논문 리뷰] How to Robustify Black-Box ML Models? A Zeroth-Order Optimization Perspective

Yimeng Zhang, Yuguang Yao|arXiv (Cornell University)|2022. 03. 27.
Adversarial Robustness in Machine Learning인용 수 12
한 줄 요약

이 논문은 자동에코더를 통해 분산 감소된 제로차수 최적화를 통합함으로써, 오직 입력 쿼리와 출력 피드백만을 사용하여 기계 학습 모델의 강건성을 향상시키는 새로운 블랙박스 방어 방법 ZO-AE-DS를 제안한다. 이 방법은 이미지 분류 및 이미지 복원 작업 모두에서 기존 방법에 비해 훨씬 낮은 쿼리 복잡도로 최신 기준의 인증된 강건성과 정확도를 달성한다.

ABSTRACT

The lack of adversarial robustness has been recognized as an important issue for state-of-the-art machine learning (ML) models, e.g., deep neural networks (DNNs). Thereby, robustifying ML models against adversarial attacks is now a major focus of research. However, nearly all existing defense methods, particularly for robust training, made the white-box assumption that the defender has the access to the details of an ML model (or its surrogate alternatives if available), e.g., its architectures and parameters. Beyond existing works, in this paper we aim to address the problem of black-box defense: How to robustify a black-box model using just input queries and output feedback? Such a problem arises in practical scenarios, where the owner of the predictive model is reluctant to share model information in order to preserve privacy. To this end, we propose a general notion of defensive operation that can be applied to black-box models, and design it through the lens of denoised smoothing (DS), a first-order (FO) certified defense technique. To allow the design of merely using model queries, we further integrate DS with the zeroth-order (gradient-free) optimization. However, a direct implementation of zeroth-order (ZO) optimization suffers a high variance of gradient estimates, and thus leads to ineffective defense. To tackle this problem, we next propose to prepend an autoencoder (AE) to a given (black-box) model so that DS can be trained using variance-reduced ZO optimization. We term the eventual defense as ZO-AE-DS. In practice, we empirically show that ZO-AE- DS can achieve improved accuracy, certified robustness, and query complexity over existing baselines. And the effectiveness of our approach is justified under both image classification and image reconstruction tasks. Codes are available at https://github.com/damon-demon/Black-Box-Defense.

연구 동기 및 목표

  • 모델 아키텍처와 파라미터가 알려져 있지 않은 블랙박스 기계 학습 모델을 방어하는 문제를 해결하기 위해, 오직 입력-출력 쿼리에 의존하는 방식을 제안한다.
  • 직접 기울기 계산이 불가능한 상황에서 기존 제로차수(ZO) 최적화의 높은 분산으로 인해 발생하는 기울기 추정의 불안정성 문제를 해결하여 강건성을 확보한다.
  • 모델 개인정보를 보존하면서도 강력한 인증된 강건성을 달성할 수 있는 실용적이고 확장 가능한 방어 프레임워크를 설계한다.
  • 공격에 노출된 상황에서 이미지 분류 및 이미지 복원 작업 모두에 대해 제안된 방법을 평가한다.

제안 방법

  • 일阶 인증 방어 기법인 노이즈 제거 스무딩(DS)을 블랙박스 환경에 적합하도록 일반화된 방어 연산으로 제안한다.
  • 기울기 없이 작동하는 제로차수(ZO) 최적화를 통합하여, 모델 기울기나 내부 파라미터에 접근하지 않아도 방어가 가능하도록 한다.
  • 자기에코더(AE)를 통합하여 ZO 기울기 추정의 분산을 감소시켜 최적화의 안정성과 수렴성을 향상시킨다.
  • 자기에코더의 잠재공간에서 분산 감소된 ZO 최적화를 사용해 DS를 훈련하는 ZO-AE-DS 방어 프레임워크를 개발한다.
  • 이중 단계 훈련 과정을 구현한다: 먼저 청소된 데이터로 자동에코더를 사전 훈련한 후, ZO 기반 최적화를 통해 자동에코더와 DS를 함께 훈련한다.
  • 효율적인 ZO 기울기 근사화를 위해 무작위 기울기 추정(RGE)과 좌표 기울기 추정(CGE)의 조합을 사용한다.

실험 결과

연구 질문

  • RQ1오직 입력-출력 쿼리만을 사용하여 인증된 방어를 블랙박스 모델에 효과적으로 적용할 수 있는가?
  • RQ2직접 기울기 계산이 불가능한 상황에서 제로차수 최적화를 어떻게 안정화시켜 강건한 방어를 달성할 수 있는가?
  • RQ3자기에코더는 제로차수 기울기 추정의 분산을 줄여 블랙박스 환경에서의 방어 성능을 향상시킬 수 있는가?
  • RQ4기존 화이트박스 및 블랙박스 방어 방법에 비해 제안된 ZO-AE-DS 방법은 강건성, 정확도, 쿼리 효율성 측면에서 어떻게 비교되는가?

주요 결과

  • 여러 이미지 분류 및 복원 작업에서 ZO-AE-DS는 FO-DS 및 ZO-DS에 비해 경쟁적인 인증된 강건성과 더 높은 표준 정확도를 확보한다.
  • 이미지 복원 작업에서 ZO-AE-DS는 PGD 공격 하에서 높은 SSIM(ℓ₂=1.0일 때 0.718)과 낮은 RMSE(0.164)를 유지하며, ZO-DS 및 FO-DS를 능가한다.
  • 기존 기준인 ZO-DS 대비 쿼리 복잡도를 크게 감소시켰으며, 업데이트당 단지 192개의 쿼리로도 유사하거나 더 우수한 성능을 달성한다.
  • 그림 5의 시각화 결과에 따르면, ZO-AE-DS는 공격 하에서도 이미지 품질을 잘 유지하는 반면, 표준 및 ZO-DS 방법은 극도로 왜곡된 복원 결과를 보인다.
  • 자기에코더 구성 요소는 일阶 최적화와 제로차수 최적화 사이의 격차를 효과적으로 메워주어, 블랙박스 환경에서 안정적이고 효과적인 훈련을 가능하게 한다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.