Skip to main content
QUICK REVIEW

[논문 리뷰] Diversity can be Transferred: Output Diversification for White- and Black-box Attacks

Yusuke Tashiro, Yang Song|arXiv (Cornell University)|2020. 03. 15.
Adversarial Robustness in Machine Learning참고 문헌 54인용 수 45
한 줄 요약

출력 다양화 샘플링(ODS)을 소개합니다. 이는 모델의 출력에서 다양성을 최대화하는 gradient 기반 샘플링 전략으로, 화이트박스 및 블랙박스 공격 모두의 효과를 개선하고 대리 모델을 통한 전이 가능성을 제공합니다.

ABSTRACT

Adversarial attacks often involve random perturbations of the inputs drawn from uniform or Gaussian distributions, e.g., to initialize optimization-based white-box attacks or generate update directions in black-box attacks. These simple perturbations, however, could be sub-optimal as they are agnostic to the model being attacked. To improve the efficiency of these attacks, we propose Output Diversified Sampling (ODS), a novel sampling strategy that attempts to maximize diversity in the target model's outputs among the generated samples. While ODS is a gradient-based strategy, the diversity offered by ODS is transferable and can be helpful for both white-box and black-box attacks via surrogate models. Empirically, we demonstrate that ODS significantly improves the performance of existing white-box and black-box attacks. In particular, ODS reduces the number of queries needed for state-of-the-art black-box attacks on ImageNet by a factor of two.

연구 동기 및 목표

  • 적대적 공격에서 입력 공간의 무작위 샘플링을 넘어 출력 다양성이 더 큰 perturbations의 필요성을 제시한다.
  • 대상 모델의 출력에서 다양성을 최대화하기 위해 출력 다양화 샘플링(Output Diversified Sampling, ODS)을 제안한다.
  • ODS가 대리 모델을 통해 전이 가능하고 화이트박스 및 블랙박스 공격 효율성을 모두 향상시킨다는 것을 보여준다.
  • 표준 데이터셋과 모델에서 공격 효과성과 질의 효율성의 경험적 향상을 보여준다.

제안 방법

  • ODS 교란 방향 v_ODS(x,f,w_d)를 w_d^T f(x)에 대한 x에 대한 정규화된 기울기로 정의한다.
  • 화이트박스 설정에서 ODI(Initialization with ODI)를 사용하여 ε-볼 안에서 w_d^T(f(x)-f(x_org))를 최대화함으로써 다양화된 시작점을 생성한다.
  • 블랙박스 설정에서 대리 모델에 ODS를 적용하여 SimBA 및 Boundary Attack과 같은 공격의 업데이트 방향을 생성한다.
  • 입력 교란의 다양성이 출력 공간의 다양성으로 이어지며, 대리 모델 기반의 ODS가 이 다양성을 대상 모델로 전이시킨다는 것을 보여준다.
  • 무작위 초기화 및 표준 기준선과 비교하여 향상된 다양성과 효율성을 보인다.

실험 결과

연구 질문

  • RQ1출력 방향의 그래디언트에 따라 입력을 섞는 것이 무작위 입력 공간 교란보다 더 다양하고 효과적인 적대적 시작점을 유도하는가?
  • RQ2대리 모델에서 생성된 ODS가 다양성을 대상 블랙박스 모델로 전이시킬 수 있는가?
  • RQ3ℓ∞ 및 ℓ2 노름 하에서 ODI가 보강된 화이트박스 공격 성능이 최첨단 공격과 비교하여 어떠한가?
  • RQ4ODS를 대리 모델 기반의 블랙박스 공격과 결합하면 질의 수와 교란 크기가 감소하는가?
  • RQ5대리 모델이 분포 외 데이터로 학습될 때도 ODS는 효과적인가?

주요 결과

  • ODS는 ℓ∞ 및 ℓ2 공격 모두에 대해 화이트박스 설정에서 공격 효과를 향상시킨다.
  • ODS와 함께한 ODI는 균등 초기화보다 더 다양한 시작점을 제공하여 CIFAR-10와 ImageNet 실험에서 필요한 교란을 줄인다.
  • ImageNet에서 점수 기반 공격에 대해 대리 모델에 적용한 ODS는 질의 수를 크게 감소시키며(약 두 배의 감소).
  • 대리 모델과 결합한 경우 ODS는 결정 기반 및 점수 기반 블랙박스 공격을 향상시켜 질의 효율과 교란 크기 측면에서 다수의 최첨단 방법을 능가한다.
  • 대리 모델이 분포 외 데이터로 학습된 경우에도 ODS는 효과적이며 대리 데이터 품질에 대한 강인성을 제공한다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.