[논문 리뷰] Random Directional Attack for Fooling Deep Neural Networks
이 논문은 랜덤 방향 공격(RDA)을 제안하며, 이는 첫 번째 선택 히ll 클라이밍을 사용하여 기울기 방향 외부의 효과적인 공격 방향을 탐색하는 단단계 적대적 공격이다. RDA는 화이트박스 및_BLK 박스 설정 모두에서 경쟁적인 성능을 달성한다. RDA는 기울기 방향 외의 비기울기 방향을 찾아내어, 기울기 방향이 실패할 경우에도 딥 네ural 네트워크를 속이는 데 성공하며, 모델 내부 정보가 필요 없이도 블랙박스 공격에서 높은 성공률을 유지한다.
Deep neural networks (DNNs) have been widely used in many fields such as images processing, speech recognition; however, they are vulnerable to adversarial examples, and this is a security issue worthy of attention. Because the training process of DNNs converge the loss by updating the weights along the gradient descent direction, many gradient-based methods attempt to destroy the DNN model by adding perturbations in the gradient direction. Unfortunately, as the model is nonlinear in most cases, the addition of perturbations in the gradient direction does not necessarily increase loss. Thus, we propose a random directed attack (RDA) for generating adversarial examples in this paper. Rather than limiting the gradient direction to generate an attack, RDA searches the attack direction based on hill climbing and uses multiple strategies to avoid local optima that cause attack failure. Compared with state-of-the-art gradient-based methods, the attack performance of RDA is very competitive. Moreover, RDA can attack without any internal knowledge of the model, and its performance under black-box attack is similar to that of the white-box attack in most cases, which is difficult to achieve using existing gradient-based attack methods.
연구 동기 및 목표
- 모델의 비선형성으로 인해 기울기 방향으로의 변형이 손실을 증가시키지 못할 경우 기울기 기반 공격의 성능이 떨어지는 문제를 해결하기 위해.
- 기울기 방향에 의존하지 않고도 성공적으로 적대적 예제를 생성할 수 있는 단단계 공격 방법을 개발하기 위해.
- 모델 내부 파rameter가 필요 없이 모델 출력만을 사용하여 효과적인 블랙박스 공격을 가능하게 하기 위해.
- 모델 아키텍처와 가중치가 알려지지 않은 상황에서 적대적 공격의 이동성과 강건성을 향상시키기 위해.
제안 방법
- RDA는 작은 변형 하에서 오분류 확률을 증가시키는 공격 방향을 반복적으로 탐색하기 위해 첫 번째 선택 히ll 클라이밍을 사용한다.
- 각 반복에서 입력 차원의 무작위 부분집합만이 변형되어 계산 비용을 줄이면서도 탐색 효율성을 유지한다.
- 성공적인 오분류를 유도할 경우에만 공격 방향을 갱신하여 국소 최적값을 피하기 위해 확률적 탐색을 수행한다.
- RDA는 모델의 출력 확률(클래스 점수)을 피드백으로 사용하여 기울기나 내부 가중치에 접근하지 않아도 블랙박스 작동이 가능하다.
- 이 방법은 단단계 공격으로 설계되어 방향 탐색 후 최종 변형을 한 번에 적용한다.
- RDA는 화이트박스 및 블랙박스 설정 모두에 적용 가능하며, 후자의 경우 대체 모델을 사용해 탐색 방향을 초기화한다.
실험 결과
연구 질문
- RQ1기울기 방향 외부의 방향을 탐색함으로써 기울기 기반 방법을 능가하는 단단계 적대적 공격를 설계할 수 있는가?
- RQ2히ll 클라이밍 기반의 탐색 전략이 딥 네럴 네트워크를 성공적으로 속이는 비기울기 방향을 효과적으로 찾을 수 있는가?
- RQ3RDA는 모델 내부 정보가 없이도 블랙박스 설정에서 높은 공격 성공률을 달성할 수 있는가?
- RQ4RDA의 성능은 성공률 및 변형 크기 측면에서 최신 기울기 기반 공격과 비교해 어떻게 되는가?
- RQ5비선형 DNN에서 효과적인 공격 방향과 기울기 방향 간의 관계는 어떠한가?
주요 결과
- MNIST에서 RDA는 ϵ = 0.1일 때 96.21%의 공격 성공률을 기록했으며, FGSM(44.63%) 및 L.L.Class(53.47%)를 크게 능가했다.
- SVHN에서 RDA는 ϵ = 0.2일 때 100%의 성공률을 기록했으며, 동일 조건에서 MI-FGSM(98.34%) 및 BIM(98.28%)를 능가했다.
- CIFAR-10에서 RDA는 테스트한 모든 ε 값에서 100%의 성공률을 기록했으며, 비교된 모든 방법과 동일하거나 이를 초월했다.
- ImageNet-10에서 RDA는 블랙박스 공격에서도 강력한 성능을 유지하여 ϵ = 0.1일 때 97.17%의 성공률을 기록했으며, FGSM의 54.90%에 비해 뛰어났다.
- 블랙박스 설정에서 RDA의 성능는 화이트박스 성능에 비해 약간 떨어졌지만, FGSM 및 BIM과 같이 심한 성능 저하를 보이지 않았다.
- 효과적인 공격 방향과 기울기 방향 사이의 각도는 크게 나타났다(예: 한 예에서 36.1°), 이는 비기울기 방향이 종종 더 효과적임을 확인한다.
더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.