Skip to main content
QUICK REVIEW

[논문 리뷰] Check Your Other Door! Creating Backdoor Attacks in the Frequency Domain

Hasan Abed Al Kader Hammoud, Bernard Ghanem|arXiv (Cornell University)|2021. 09. 12.
Adversarial Robustness in Machine Learning인용 수 7
한 줄 요약

이 논문은 깊이 신경망에서 가장 민감한 주파수 성분을 식별하고 오염시키기 위해 푸리에 히트맵을 사용하는 새로운 주파수 도메인 뒷통로 공격을 제안한다. 이는 낮은 오염 비율로도 매우 효과적이고, 시각적으로 보이지 않으며 강력한 뒷통로를 가능하게 하며, 최첨단 공격 성공률(최대 99.97%)을 달성한다. 동시에 청소년 데이터 정확도를 유지하면서도 여러 최첨단 방어 기법을 회피한다.

ABSTRACT

Deep Neural Networks (DNNs) are ubiquitous and span a variety of applications ranging from image classification to real-time object detection. As DNN models become more sophisticated, the computational cost of training these models becomes a burden. For this reason, outsourcing the training process has been the go-to option for many DNN users. Unfortunately, this comes at the cost of vulnerability to backdoor attacks. These attacks aim to establish hidden backdoors in the DNN so that it performs well on clean samples, but outputs a particular target label when a trigger is applied to the input. Existing backdoor attacks either generate triggers in the spatial domain or naively poison frequencies in the Fourier domain. In this work, we propose a pipeline based on Fourier heatmaps to generate a spatially dynamic and invisible backdoor attack in the frequency domain. The proposed attack is extensively evaluated on various datasets and network architectures. Unlike most existing backdoor attacks, the proposed attack can achieve high attack success rates with low poisoning rates and little to no drop in performance while remaining imperceptible to the human eye. Moreover, we show that the models poisoned by our attack are resistant to various state-of-the-art (SOTA) defenses, so we contribute two possible defenses that can evade the attack.

연구 동기 및 목표

  • 외주 DNN 학습의 뒷통로 공격에 대한 취약성을 해결하기 위해 더 은밀하고 효과적인 방법을 개발하기 위해.
  • 고정된, 시각적으로 명백한 트리거로 인해 자주 감지되는 공간 도메인 뒷통로 공격의 한계를 극복하기 위해.
  • 가장 민감한 주파수 성분을 공격 대상으로 삼는 주파수 도메인 공격을 설계하여, 은밀성과 방어 기법에 대한 내성 향상시키기 위해.
  • 최첨단 뒷통로 방어 기법에 대한 공격의 강건성과 회피 능력을 평가하기 위해.
  • 제안된 주파수 도메인 뒷통로 공격을 탐지하고 완화할 수 있는 두 가지 새로운 방어 기법을 제안하기 위해.

제안 방법

  • 기존에 학습된 모델의 가장 민감한 주파수 성분을 기울기 기반 감도 분석에 기반해 푸리에 히트맵을 구성한다.
  • 상위-k개의 가장 민감한 주파수 성분을 선택하고, 이 성분들을 학습 데이터에서 수정함으로써 공간적으로 동적인, 시각적으로 보이지 않는 트리거를 삽입한다.
  • 선택된 주파수 대역에서 위상이나 진폭을 랜덤화함으로써 각 이미지마다 다른 트리거 패턴을 사용하여 은밀성을 향상시킨다.
  • 오염는 데이터 전처리 단계에서 적용되며, 정제된 이미지를 주파수 도메인으로 변환하고 트리거로 수정한 후 다시 공간 도메인으로 변환한다.
  • PSNR, LPIPS, CDA, ASR 등의 지표를 사용하여 ResNet, DenseNet, VGG 등의 다양한 아키텍처와 CIFAR-10, ImageNet 등의 데이터셋에서 평가한다.
  • 두 가지 방어 기법을 제안한다: JPEG 압축과 오토에인코더 기반 재구성으로, 오염된 성분을 제거하거나 왜곡시켜 주파수 도메인 트리거를 무력화한다.

실험 결과

연구 질문

  • RQ1주파수 도메인 뒷통로 공격가 낮은 오염 비율로도 높은 공격 성공률과 높은 정제된 데이터 정확도를 유지할 수 있는가?
  • RQ2기존의 공간 도메인 뒷통로 공격에 비해 제안된 주파수 도메인 공격는 은밀성과 강건성 측면에서 어떻게 비교되는가?
  • RQ3왜 잔차 네트워크는 VGG19와 같은 비잔차 네트워크보다 뒷통로 공격에 더 취약한가?
  • RQ4제안된 공격는 Spectral Signatures와 활성화 클러스터링과 같은 최첨단 뒷통로 탐지 방어 기법을 회피할 수 있는가?
  • RQ5주파수 도메인 뒷통로 공격에 효과적인 방어 기법은 무엇이며, 성능 측면에서 어떻게 비교되는가?

주요 결과

  • 제안된 공격는 VGG19에서 오직 10%의 오염 비율로도 99.97%의 공격 성공률를 기록하며, ASR 및 PSNR/LPIPS 지표에서 모든 공간 도메인 공격를 능가한다.
  • 0.4%의 오염 비율에서 ResNet18에서는 정제된 데이터 정확도 94.38%를 유지하면서도 99.44%의 공격 성공률를 기록하여 높은 효율성과 은밀성을 입증한다.
  • 다양한 최첨단 방어 기법을 회피한다: Spectral Signatures는 ResNet50에서 오직 33%의 경우에만 뒷통로를 감지하며, 활성화 클러스터링은 클래스 간 유사한 실루엣 점수로 인해 뒷통로를 탐지하지 못한다.
  • JPEG 압축과 오토에인코더 기반 방어 기법에 대해 매우 강건한데, 오토에인코더를 사용할 경우 공격 성공률가 각각 83.15%와 0.00%로 떨어지기만 한다.
  • 잔차 네트워크(예: ResNet, DenseNet)는 오염 정보를 유지하는 스킵 연결 덕분에 더 취약하며, 비잔차 네트워크인 VGG19는 유사한 성공률를 달성하기 위해 더 높은 오염 비율이 필요하다.
  • 제안된 방어 기법인 JPEG 압축과 오토에인코더는 공격를 효과적으로 무력화하며, 각각 ASR를 0.00%와 71.43%로 낮춘다. 이는 주파수 도메인 방어 기법이 효과적일 수 있음을 보여준다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.