Skip to main content
QUICK REVIEW

[논문 리뷰] Robustness and Transferability of Universal Attacks on Compressed Models

Alberto G. Matachana, Kenneth T. Co|arXiv (Cornell University)|2020. 12. 10.
Adversarial Robustness in Machine Learning참고 문헌 49인용 수 7
한 줄 요약

이 논문은 소프트 필터 프루닝과 양자화—일반적으로 사용되는 모델 압축 기법—이 딥 네ural 네트워크 내 유니버설 적대적 편향(UAPs)의 강건성과 전이 가능성에 미치는 영향을 조사한다. 연구 결과, 소프트 필터 프루닝은 모델의 특징 공간을 변화시켜 UAP 전이 공격에 대한 강건성을 향상시키는 것으로 나타났으며, 반면 양자화는 기울기 마스킹을 유도할 수 있어 잘못된 안전감을 줄 수 있다. 압축된 모델과 전체 정밀도 모델 간의 전이 가능성은 제한적이며, 특히 다양한 프루닝 방법 간에는 전이 가능성의 차이가 크므로, 엣지 배포 환경에서 압축 기법을 방어 전략으로 활용할 수 있음을 시사한다.

ABSTRACT

Neural network compression methods like pruning and quantization are very effective at efficiently deploying Deep Neural Networks (DNNs) on edge devices. However, DNNs remain vulnerable to adversarial examples-inconspicuous inputs that are specifically designed to fool these models. In particular, Universal Adversarial Perturbations (UAPs), are a powerful class of adversarial attacks which create adversarial perturbations that can generalize across a large set of inputs. In this work, we analyze the effect of various compression techniques to UAP attacks, including different forms of pruning and quantization. We test the robustness of compressed models to white-box and transfer attacks, comparing them with their uncompressed counterparts on CIFAR-10 and SVHN datasets. Our evaluations reveal clear differences between pruning methods, including Soft Filter and Post-training Pruning. We observe that UAP transfer attacks between pruned and full models are limited, suggesting that the systemic vulnerabilities across these models are different. This finding has practical implications as using different compression techniques can blunt the effectiveness of black-box transfer attacks. We show that, in some scenarios, quantization can produce gradient-masking, giving a false sense of security. Finally, our results suggest that conclusions about the robustness of compressed models to UAP attacks is application dependent, observing different phenomena in the two datasets used in our experiments.

연구 동기 및 목표

  • 압축된 DNN의 유니버설 적대적 편향(UAPs)에 대한 강건성에 프루닝과 양자화가 미치는 영향을 평가하기 위해.
  • 압축 모델과 그 전체 정밀도 복제 모델 간의 UAP 전이 가능성에 대해 조사하기 위해.
  • 압축 기법이 엣지 AI 시스템에서 블랙박스 UAP 공격에 대응하는 방어 수단으로 기능할 수 있는지 평가하기 위해.
  • CIFAR-10 및 SVHN과 같은 데이터셋에서 소프트 필터 프루닝, 사후 훈련 프루닝, 양자화와 같은 다양한 압축 방법의 성능 및 강건성을 비교하기 위해.
  • UAP에 대한 강건성이 데이터셋 간 일관성 있는지 여부 또는 애플리케이션에 따라 달라지는지 확인하기 위해.

제안 방법

  • CIFAR-10 및 SVHN에서 훈련된 압축 모델을 대상으로 화이트박스 및 전이 공격 설정을 통해 UAP 강건성을 실증적으로 평가하기 위해.
  • 다양한 압축 기법을 적용: 소프트 필터 프루닝(SFP), 사후 훈련 프루닝(PP), 양자화(Q), 전체 정밀도 모델과 비교하기 위해.
  • PGD와 같은 반복 최적화 방법을 사용하여 UAP를 생성하며, 타겟되지 않은 공격과 타겟된 공격에 모두 맞춤형으로 조정하기 위해.
  • 한 모델에서 UAP를 제작하고 다른 모델에서 테스트함으로써 전이 가능성을 평가하며, 압축된 모델과 압축되지 않은 모델 간의 전이 가능성도 포함하기 위해.
  • SFP 모델에서 UAP 강건성에 미치는 영향을 평가하기 위해 훈련 중에 mixup 및 cutout과 같은 정규화 기법을 사용하기 위해.
  • SFP 모델과 전체 모델 간의 특징 공간 차이를 분석하여 관찰된 전이 가능성의 차이를 설명하기 위해.

실험 결과

연구 질문

  • RQ1프루닝과 양자화를 통한 모델 압축이 DNN의 유니버설 적대적 편향(UAPs)에 대한 강건성에 어떤 영향을 미치는가?
  • RQ2UAP는 압축 모델과 그 전체 정밀도 복제 모델 간에 어느 정도 전이되는가?
  • RQ3소프트 필터 프루닝과 같은 다양한 프루닝 전략이 UAP의 전이 가능성 감소를 통해 보안을 향상시킬 수 있는가?
  • RQ4양자화는 진정으로 강건성을 제공하는가, 아니면 기울기 마스킹을 유도하여 잘못된 안전감을 줄 수 있는가?
  • RQ5데이터셋 기반의 데이터 분포가 압축 모델의 UAP 공격에 대한 강건성에 어떤 영향을 미치는가?

주요 결과

  • 소프트 필터 프루닝(SFP)은 모델 간 UAP 전이 가능성의 감소를 크게 유도하여, 공격 성공률을 저하시키는 특징 공간의 구조적 변화를 암시한다.
  • 사후 훈련 프루닝(PP)과 전체 정밀도 모델 간의 UAP 전이 가능성은 제한적이며, 이는 원본 모델과 동일한 체계적 취약성을 유지하지 않는다는 것을 시사한다.
  • 양자화는 기울기 마스킹을 유도할 수 있으며, 이는 높은 정확도를 보이지만 새로운 공격에 대한 일반화 능력이 떨어지는 바탕으로 잘못된 강건성 인식을 유도할 수 있음을 입증한다.
  • CIFAR-10에서는 SFP에 mixup 및 cutout 정규화를 결합함으로써 타겟된 UAP에 대한 강건성이 향상되나, SVHN에서는 동일한 기법이 강건성을 떨어뜨리는 것으로 나타나 데이터셋 의존성이 뚜렷하다.
  • 압축 기법이 UAP 강건성을 향상시키는 데 효과적인지 여부는 데이터셋 간 일관성이 없으며, 이는 강건성 결과가 애플리케이션 및 데이터에 매우 의존적임을 시사한다.
  • 특히 소프트 필터 프루닝을 사용해 모델을 압축할 경우 UAP의 전이 가능성은 크게 감소하며, 이는 다양한 기법을 사용해 여러 압축된 버전을 배포함으로써 블랙박스 UAP 위협을 완화할 수 있음을 시사한다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.