[논문 리뷰] Diversity can be Transferred: Output Diversification for White- and Black-box Attacks
출력 다양화 샘플링(ODS)을 소개합니다. 이는 모델의 출력에서 다양성을 최대화하는 gradient 기반 샘플링 전략으로, 화이트박스 및 블랙박스 공격 모두의 효과를 개선하고 대리 모델을 통한 전이 가능성을 제공합니다.
Adversarial attacks often involve random perturbations of the inputs drawn from uniform or Gaussian distributions, e.g., to initialize optimization-based white-box attacks or generate update directions in black-box attacks. These simple perturbations, however, could be sub-optimal as they are agnostic to the model being attacked. To improve the efficiency of these attacks, we propose Output Diversified Sampling (ODS), a novel sampling strategy that attempts to maximize diversity in the target model's outputs among the generated samples. While ODS is a gradient-based strategy, the diversity offered by ODS is transferable and can be helpful for both white-box and black-box attacks via surrogate models. Empirically, we demonstrate that ODS significantly improves the performance of existing white-box and black-box attacks. In particular, ODS reduces the number of queries needed for state-of-the-art black-box attacks on ImageNet by a factor of two.
연구 동기 및 목표
- 적대적 공격에서 입력 공간의 무작위 샘플링을 넘어 출력 다양성이 더 큰 perturbations의 필요성을 제시한다.
- 대상 모델의 출력에서 다양성을 최대화하기 위해 출력 다양화 샘플링(Output Diversified Sampling, ODS)을 제안한다.
- ODS가 대리 모델을 통해 전이 가능하고 화이트박스 및 블랙박스 공격 효율성을 모두 향상시킨다는 것을 보여준다.
- 표준 데이터셋과 모델에서 공격 효과성과 질의 효율성의 경험적 향상을 보여준다.
제안 방법
- ODS 교란 방향 v_ODS(x,f,w_d)를 w_d^T f(x)에 대한 x에 대한 정규화된 기울기로 정의한다.
- 화이트박스 설정에서 ODI(Initialization with ODI)를 사용하여 ε-볼 안에서 w_d^T(f(x)-f(x_org))를 최대화함으로써 다양화된 시작점을 생성한다.
- 블랙박스 설정에서 대리 모델에 ODS를 적용하여 SimBA 및 Boundary Attack과 같은 공격의 업데이트 방향을 생성한다.
- 입력 교란의 다양성이 출력 공간의 다양성으로 이어지며, 대리 모델 기반의 ODS가 이 다양성을 대상 모델로 전이시킨다는 것을 보여준다.
- 무작위 초기화 및 표준 기준선과 비교하여 향상된 다양성과 효율성을 보인다.
실험 결과
연구 질문
- RQ1출력 방향의 그래디언트에 따라 입력을 섞는 것이 무작위 입력 공간 교란보다 더 다양하고 효과적인 적대적 시작점을 유도하는가?
- RQ2대리 모델에서 생성된 ODS가 다양성을 대상 블랙박스 모델로 전이시킬 수 있는가?
- RQ3ℓ∞ 및 ℓ2 노름 하에서 ODI가 보강된 화이트박스 공격 성능이 최첨단 공격과 비교하여 어떠한가?
- RQ4ODS를 대리 모델 기반의 블랙박스 공격과 결합하면 질의 수와 교란 크기가 감소하는가?
- RQ5대리 모델이 분포 외 데이터로 학습될 때도 ODS는 효과적인가?
주요 결과
- ODS는 ℓ∞ 및 ℓ2 공격 모두에 대해 화이트박스 설정에서 공격 효과를 향상시킨다.
- ODS와 함께한 ODI는 균등 초기화보다 더 다양한 시작점을 제공하여 CIFAR-10와 ImageNet 실험에서 필요한 교란을 줄인다.
- ImageNet에서 점수 기반 공격에 대해 대리 모델에 적용한 ODS는 질의 수를 크게 감소시키며(약 두 배의 감소).
- 대리 모델과 결합한 경우 ODS는 결정 기반 및 점수 기반 블랙박스 공격을 향상시켜 질의 효율과 교란 크기 측면에서 다수의 최첨단 방법을 능가한다.
- 대리 모델이 분포 외 데이터로 학습된 경우에도 ODS는 효과적이며 대리 데이터 품질에 대한 강인성을 제공한다.
더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.