[논문 리뷰] Enhanced Attacks on Defensively Distilled Deep Neural Networks
이 논문은 흰 상자 환경에서 방어적 분산된 DNN에 대해 100% 성공률를 달성하면서도 높은 시각적 품질과 빠른 생성 속도를 보이는 새로운 $ε$-근접 공격을 제안한다. 이를 바탕으로, 출력 확률 벡터만 이용 가능한 영역 기반 흑상자 공격과 저온 모델을 활용한 우회 공격을 제안하여, 방어적 분산이 적용된 네트워크가 여전히 취약함을 입증한다.
Deep neural networks (DNNs) have achieved tremendous success in many tasks of machine learning, such as the image classification. Unfortunately, researchers have shown that DNNs are easily attacked by adversarial examples, slightly perturbed images which can mislead DNNs to give incorrect classification results. Such attack has seriously hampered the deployment of DNN systems in areas where security or safety requirements are strict, such as autonomous cars, face recognition, malware detection. Defensive distillation is a mechanism aimed at training a robust DNN which significantly reduces the effectiveness of adversarial examples generation. However, the state-of-the-art attack can be successful on distilled networks with 100% probability. But it is a white-box attack which needs to know the inner information of DNN. Whereas, the black-box scenario is more general. In this paper, we first propose the epsilon-neighborhood attack, which can fool the defensively distilled networks with 100% success rate in the white-box setting, and it is fast to generate adversarial examples with good visual quality. On the basis of this attack, we further propose the region-based attack against defensively distilled DNNs in the black-box setting. And we also perform the bypass attack to indirectly break the distillation defense as a complementary method. The experimental results show that our black-box attacks have a considerable success rate on defensively distilled networks.
연구 동기 및 목표
- 기존의 방어적 분산된 DNN에 대한 공격 방식이 풀 흰 상자 접근이 필요하고 느리다는 한계를 해결하기 위해.
- 각 픽셀의 변형을 제약하는 $ε$-근접 제약 조건을 사용하여 빠르고 고품질의 흰 상자 공격을 개발하기 위해.
- 최종 출력 확률 벡터만을 이용하여 방어적 분산된 네트워크에 효과적인 흑상자 공격을 가능하게 하기 위해.
- 저온도로 분산된 모델을 공격하여 고온도로 더 안전한 모델을 우회로 공격하는 우회 공격 전략을 제안하기 위해.
- 실제 흑상자 환경, 예를 들어 MLaaS에서 방어적 분산이 충분한 보안 보장을 제공하지 못함을 입증하기 위해.
제안 방법
- 각 픽셀의 최대 변형량을 제약하여 눈에 띄지 않으며 고품질의 대비 예측 예제를 생성하는 $ε$-근접 공격을 제안한다.
- 제약 최적화 프레임워크를 사용하여, $ε = 1$일 때조차도 빠른 수렴을 이룰 수 있는 타겟 공격 예제를 생성한다.
- 방어적 분산된 네트워크의 출력 확률 벡터만을 쿼리하는 영역 기반 공격을 도입하여 흑상자 환경에서 작동한다.
- 저온도(낮은-$T$) 모델에서 대비 예제를 생성하고 이를 고온도(높은-$T$) 분산 모델로 전이시키는 우회 공격 전략을 활용한다.
- 낮은-$T$ 모델은 공격하기가 더 쉽고, 서로 다른 분산 온도를 가진 모델 간에 대비 예제가 전이된다는 사실을 활용한다.
- CIFAR-10, ImageNet, MNIST 등에 대해 Inception-v3 및 기타 아키텍처를 사용하여 검증하였으며, 흑상자 조건에서도 높은 성공률를 보였다.
실험 결과
연구 질문
- RQ1각 픽셀의 변형을 제약함으로써 방어적 분산된 DNN를 효과적으로 속일 수 있는 빠르고 고품질의 흰 상자 공격를 설계할 수 있는가?
- RQ2방어적 분산된 네트워크의 최종 출력 확률 벡터만 제공되는 조건에서 효과적인 흑상자 공격를 구성할 수 있는가?
- RQ3저온도로 분산된 모델에서 생성된 대비 예제가 고온도로 분산된 모델을 성공적으로 공격할 수 있으며, 분산 보안을 우회할 수 있는가?
- RQ4실제 MLaaS와 같은 흑상자 배포 환경에서 방어적 분산이 DNN를 충분히 보호하지 못하는 정도는 어느 정도인가?
- RQ5다양한 변형 한계($\epsilon$)와 모델 온도에 따라 흑상자 공격의 성공률는 어떻게 변하는가?
주요 결과
- $ε$-근접 공격는 흰 상자 환경에서 방어적 분산된 네트워크에 대해 $ε = 1$일 때도 100% 성공률를 달성한다.
- Inception-v3를 사용한 ImageNet에서 공격는 최대 픽셀 단위 변형량이 2 미만이면서도 임의의 타겟 클래스로 오분류를 유도한다.
- 영역 기반 흑상자 공격는 $ε$를 1로 고정했을 때 70% 초과의 성공률를 기록하여 제한된 액세스 조건에서도 효과적임을 입증한다.
- 우회 공격는 타겟 모델에 직접 액세스할 수 없더라도 저온도 모델에서 생성된 대비 예제를 사용하여 고온도 방어적 분산 모델을 성공적으로 공격한다.
- MLaaS 환경에서는 저온도로 분산된 모델이 공개된 이후, 그로부터 생성된 대비 예제를 사용해 향후 고온도 모델을 공격할 수 있어 장기적 보안을 약화시킨다.
- 생성된 대비 예제는 인간 관찰자들이 원본 이미지와 구분할 수 없을 정도로 시각적으로 인식 불가능하다.
더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.