Skip to main content
QUICK REVIEW

[논문 리뷰] Meta-Learning the Search Distribution of Black-Box Random Search Based Adversarial Attacks

Maksym Yatsura, Jan Hendrik Metzen|arXiv (Cornell University)|2021. 11. 02.
Adversarial Robustness in Machine Learning인용 수 5
한 줄 요약

이 논문은 블랙박스 랜덤 서치 적대적 공격을 위한 검색 분포 파라미터—예를 들어 업데이트 크기와 색상 샘플링—를 자동으로 최적화하는 메타러닝 프레임워크인 메타 스퀘어 어택(Meta Square Attack, MSA)을 제안한다. 화이트박스 모델에서 기울기 기반 컨트롤러를 훈련시킴으로써 MSA는 다양한 모델, 데이터셋(CIFAR10, CIFAR100, ImageNet), 공격 설정(타겟 공격 포함)에서 쿼리 효율성과 강건성 추정치를 최대 20% 향상시킨다.

ABSTRACT

Adversarial attacks based on randomized search schemes have obtained state-of-the-art results in black-box robustness evaluation recently. However, as we demonstrate in this work, their efficiency in different query budget regimes depends on manual design and heuristic tuning of the underlying proposal distributions. We study how this issue can be addressed by adapting the proposal distribution online based on the information obtained during the attack. We consider Square Attack, which is a state-of-the-art score-based black-box attack, and demonstrate how its performance can be improved by a learned controller that adjusts the parameters of the proposal distribution online during the attack. We train the controller using gradient-based end-to-end training on a CIFAR10 model with white box access. We demonstrate that plugging the learned controller into the attack consistently improves its black-box robustness estimate in different query regimes by up to 20% for a wide range of different models with black-box access. We further show that the learned adaptation principle transfers well to the other data distributions such as CIFAR100 or ImageNet and to the targeted attack setting.

연구 동기 및 목표

  • 블랙박스 랜덤 서치 적대적 공격을 위한 제안 분포의 수동 튜닝과 히우리스틱 설계 문제를 해결한다.
  • 적응형 검색 전략을 학습시켜 블랙박스 환경에서의 쿼리 효율성과 강건성 추정치를 향상시킨다.
  • 학습된 컨트롤러를 다양한 모델, 데이터셋(e.g., CIFAR100, ImageNet), 공격 유형(타겟 공격 포함) 간에 이식 가능하게 한다.
  • 메타훈련 이후 기울기 접근 없이도 완전히 블랙박스 환경에서 효과적으로 작동하는 방법을 개발한다.
  • 학습된 컨트롤러가 다양한 쿼리 예산과 위협 모델(ℓ∞, ℓ2)에서 수동으로 설계된 스케줄링보다 우수한 성능을 보임을 입증한다.

제안 방법

  • 검색 분포 파라미터(예: 업데이트 크기, 색상 샘플링) 최적화 문제를 적응적으로 공격 성능을 향상시키기 위한 메타러닝 문제로 재정의한다.
  • 적대적으로 훈련된 ResNet18을 사용한 화이트박스 CIFAR10 모델에서 기울기 기반 엔드 투 엔드 최적화를 통해 컨트롤러를 훈련시킨다.
  • 공격 중에 제안 분포를 동적으로 조정하기 위해 학습된 컨트롤러를 사용하며, 이전 연구에서 사용된 고정 스케줄링을 대체한다.
  • 메타훈련 단계(화이트박스 접근 가능)와 추론 단계(완전히 블랙박스)를 분리하여 기울기 가로막힘 문제를 방지한다.
  • 메타훈련된 컨트롤러를 RobustBench 자료집 내 다양한 모델에 적용하여 재훈련 없이도 블랙박스 적대자로 활용한다.
  • 업데이트 크기(MSA_s)와 색상 샘플링(MSA_c)을 위한 두 개의 컨트롤러를 도입하며, 모두 공격 성공률을 최대화하도록 훈련한다.

실험 결과

연구 질문

  • RQ1메타러닝을 사용해 블랙박스 랜덤 서치 적대적 공격의 검색 분포를 자동으로 최적화할 수 있는가? 이는 수동 설계에 대한 의존도를 줄일 수 있는가?
  • RQ2다양한 쿼리 예산에서 학습된 컨트롤러의 성능은 수동으로 설계된 스케줄링(Square Attack, AutoAttack 등)과 비교해 어떻게 되는가?
  • RQ3메타로 학습된 컨트롤러는 새로운 모델, 데이터셋(e.g., CIFAR100, ImageNet), 타겟 공격 설정으로까지 얼마나 잘 일반화되는가?
  • RQ4학습된 적응 전략은 블랙박스 환경에서 강건성 평가 정확도와 쿼리 효율성을 향상시키는가?
  • RQ5컨트롤러는 화이트박스 설정에서 훈련된 후 완전히 블랙박스 공격 시나리오에서 효과적으로 배포될 수 있는가?

주요 결과

  • 메타 스퀘어 어택(MSA)은 다양한 쿼리 예산과 모델에서 최신 기준(Square Attack, AutoAttack) 대비 강건성 추정치를 최대 20% 향상시킨다.
  • 업데이트 크기 전용 MSA_s 컨트롤러는 블랙박스 접근이 가능한 CIFAR10 모델에서 공격 성공률을 최대 5.6% 향상시키며, 특히 저예산 환경에서 유의미한 성능 향상을 보인다.
  • 색상 샘플링 전용 MSA_c 컨트롤러는 균일 샘플링(p = 0.125) 대비 검정 및 흰색 픽셀(p ≈ 0.18)을 선호하도록 학습하며, 이는 모델에 특화된 취약점을 반영한다.
  • MSA_s와 MSA_c의 조합은 기준 스케줄링 대비 일관된 성능 향상을 이끌어내며, 500에서 5000 쿼리 예산 범위에서 모두 성과 향상을 보인다.
  • MSA는 CIFAR100과 ImageNet으로도 효과적으로 일반화되며, 타겟 공격 설정에서 최신 기준 대비 최대 20% 높은 강건 정확도를 달성한다.
  • 제거 실험 결과, MSA_s와 MSA_c가 성능 향상에 독립적으로 기여하며, 특히 초기 공격 단계에서 MSA_c가 특히 유의미한 이점을 제공한다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.