Skip to main content
QUICK REVIEW

[논문 리뷰] Fault Sneaking Attack: a Stealthy Framework for Misleading Deep Neural Networks

Pu Zhao, Siyue Wang|arXiv (Cornell University)|2019. 05. 28.
Adversarial Robustness in Machine Learning참고 문헌 33인용 수 12
한 줄 요약

이 논문은 특정 입력을 오분류하면서도 전체 모델 정확도를 유지하는 침투성 있는 딥러닝 공격인 Fault Sneaking 공격을 제안한다. ADMM와 ℓ₀ 및 ℓ₂ 노름 제약 조건을 사용하여, 최소한의 매개수 변경으로 다수의 타겟 오분류를 달성하고, 16개의 결함을 삽입한 경우에도 1% 미만의 정확도 저하를 기록한다.

ABSTRACT

Despite the great achievements of deep neural networks (DNNs), the vulnerability of state-of-the-art DNNs raises security concerns of DNNs in many application domains requiring high reliability.We propose the fault sneaking attack on DNNs, where the adversary aims to misclassify certain input images into any target labels by modifying the DNN parameters. We apply ADMM (alternating direction method of multipliers) for solving the optimization problem of the fault sneaking attack with two constraints: 1) the classification of the other images should be unchanged and 2) the parameter modifications should be minimized. Specifically, the first constraint requires us not only to inject designated faults (misclassifications), but also to hide the faults for stealthy or sneaking considerations by maintaining model accuracy. The second constraint requires us to minimize the parameter modifications (using L0 norm to measure the number of modifications and L2 norm to measure the magnitude of modifications). Comprehensive experimental evaluation demonstrates that the proposed framework can inject multiple sneaking faults without losing the overall test accuracy performance.

연구 동기 및 목표

  • 하드웨어 기반 결함 주입 공격에 취약한 딥 뉴럴 네트워크(DNNs)의 보안 취약점을 해결한다.
  • 전체 모델 정확도를 떨어뜨리지 않고 DNN 매개수를 수정하여 다수의 타겟 오분류를 유도하는 방법을 개발한다.
  • 대부분의 입력에 대해 정확한 분류를 유지하고 매개수 변경을 최소화함으로써 침투성을 확보한다.
  • 공격에 성공하기 위해 필요한 매개수 변경의 수와 크기를 줄여 하드웨어 구현의 효율성을 높인다.

제안 방법

  • 비타겟 이미지 R−S장에 대해 정확한 분류를 유지하고 매개수 변경을 최소화하는 조건 하에 Fault Sneaking 공격를 최적화 문제로 공식화한다.
  • 해석적 해를 가진 분할 역할 방법(Alternating Direction Method of Multipliers, ADMM)을 사용하여 최적화 문제를 해결한다.
  • ℓ₀ 노름을 사용해 수정된 매개수의 수를 최소화하고, ℓ₂ 노름을 사용해 변경의 크기를 최소화한다.
  • 단지 소량의 설정 변경으로도 ℓ₀ 및 ℓ₂ 노름 최소화를 지원하는 일반적인 ADMM 프레임워크를 구현한다.
  • 모델 매개수와 이중 변수를 번갈아 업데이트함으로써 반복적으로 문제를 해결하고, 제약 조건 하에서 수렴을 보장한다.
  • 두 단계 최적화 과정을 사용한다: 첫째, 수정할 핵심 매개수를 식별하고, 둘째, 정확도 및 침투성 제약 조건을 만족하도록 변경을 정밀 조정한다.

실험 결과

연구 질문

  • RQ1특정 입력을 오분류하기 위해 다른 입력의 정확도를 유지하면서 몇 개의 매개수만 수정할 수 있는가?
  • RQ2실제 하드웨어 기반 결함 주입을 가능하게 하기 위해 매개수 수정의 수와 크기를 어떻게 최소화할 수 있는가?
  • RQ3모델 성능이 크게 떨어지기 전까지 침투성 결함을 최대 몇 개까지 삽입할 수 있는가?
  • RQ4휴리스틱 또는 회피 기반 방법과 비교해 ADMM 기반 최적화 프레임워크는 침투성과 효율성 측면에서 어떻게 다른가?

주요 결과

  • S ≤ 10일 경우, 16개의 타겟 이미지를 100% 성공률로 오분류하는 데 성공하여 소규모 공격에 대해 매우 높은 신뢰성을 입증한다.
  • S = 16일 경우, R = 1000일 때 MNIST에서 테스트 정확도 96.9%, CIFAR-10에서 76.4%를 유지하여 원본 모델 대비 각각 0.8%와 1.0%의 정확도 저하만 기록한다.
  • 유사 조건 하에서 이전 연구 대비 훨씬 낮은 정확도 저하를 기록한다: MNIST의 경우 3.86%, CIFAR-10의 경우 2.35%의 저하.
  • S > 10일 경우 성공률가 100% 이하로 떨어지므로, 마지막 완전 연결 층 수정을 통한 약 10개의 성공적인 오분류가 실용적인 내성 한계임을 시사한다.
  • ℓ₀ 기반 공격는 수정된 매개수를 MNIST 기준 1026개, CIFAR-10 기준 804개로 줄였고, ℓ₂ 기반 공격는 매개수 크기의 감소를 더 효과적으로 달성하여 희박성과 크기 사이의 트레이드오프를 보여준다.
  • R(정확히 분류된 이미지 수)를 증가시키면 전체 테스트 정확도가 크게 향상되어, 더 많은 양의 정상 분류를 유지할수록 공격 후 모델 안정성이 높아지는 것으로 나타났다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.