Skip to main content
QUICK REVIEW

[논문 리뷰] Check Your Other Door! Establishing Backdoor Attacks in the Frequency Domain

Hasan Abed Al Kader Hammoud, Bernard Ghanem|arXiv (Cornell University)|2021. 09. 12.
Adversarial Robustness in Machine Learning참고 문헌 11인용 수 7
한 줄 요약

이 논문은 주어진 상태의 방어 기법을 회피할 수 있는 동적이고 비가시적이며 매우 효과적인 트리거를 제공하는 주파수 도메인에서 작동하는 새로운 백도어 공격을 제안한다. 모델 훈련 중 주파수 도메인 조작을 활용함으로써, 다양한 데이터셋과 아키텍처에서 높은 성공률을 달성하면서도 기존 탐지 기법에 의해 감지되지 않도록 한다.

ABSTRACT

Deep Neural Networks (DNNs) have been utilized in various applications ranging from image classification and facial recognition to medical imagery analysis and real-time object detection. As our models become more sophisticated and complex, the computational cost of training such models becomes a burden for small companies and individuals; for this reason, outsourcing the training process has been the go-to option for such users. Unfortunately, outsourcing the training process comes at the cost of vulnerability to backdoor attacks. These attacks aim at establishing hidden backdoors in the DNN such that the model performs well on benign samples but outputs a particular target label when a trigger is applied to the input. Current backdoor attacks rely on generating triggers in the image/pixel domain; however, as we show in this paper, it is not the only domain to exploit and one should always check the other doors. In this work, we propose a complete pipeline for generating a dynamic, efficient, and invisible backdoor attack in the frequency domain. We show the advantages of utilizing the frequency domain for establishing undetectable and powerful backdoor attacks through extensive experiments on various datasets and network architectures. The backdoored models are shown to break various state-of-the-art defences. We also show two possible defences that succeed against frequency-based backdoor attacks and possible ways for the attacker to bypass them. We conclude the work with some remarks regarding a network's learning capacity and the capability of embedding a backdoor attack in the model.

연구 동기 및 목표

  • 기존의 픽셀 도메인 방법을 넘어서 주파수 도메인에서 딥 신경망의 백도어 공격에 대한 취약성을 조사하기 위해.
  • 기존 탐지 및 방어 기법을 회피할 수 있는 동적이고 효율적이며 비가시적인 주파수 도메인 백도어 공격 파이프라인을 개발하기 위해.
  • 제안된 공격이 최신 방어 기법에 대해 얼마나 견고한지 평가하고 잠재적인 대응 조치를 규명하기 위해.
  • 모델 용량과 주파수 도메인에서 백도어를 임베딩하는 데의 가능성 사이의 관계를 분석하기 위해.

제안 방법

  • 공격는 입력 이미지의 주파수 성분을 푸리에 도메인에서의 학습 가능한 변환을 사용해 수정함으로써 동적 트리거를 생성한다.
  • 주파수 도메인 트리거는 입력의 푸리에 표현에 대해 미분 가능한 변환을 적용함으로써 모델 훈련 중에 임베딩된다.
  • 이 방법은 DNN가 주파수 도메인 변형에 대해 내재된 불변성을 활용하여 도청적인 백도어 임플리케이션을 가능하게 한다.
  • 공격는 주파수 스펙트럼에서 에너지 변화를 최소화함으로써 시각적으로 감지되지 않도록 보장한다.
  • 일반화 능력을 입증하기 위해 여러 데이터셋(e.g., CIFAR-10, ImageNet)과 아키텍처(e.g., ResNet, VGG)에서 프레임워크를 평가한다.
  • 두 가지 잠재적 방어 기법으로 주파수 필터링과 적대적 훈련을 탐색하고, 이를 우회하기 위한 대응 조치를 제안한다.

실험 결과

연구 질문

  • RQ1백도어 공격를 픽셀 도메인 대신 주파수 도메인에서 효과적이고 비가시적으로 수행할 수 있는가?
  • RQ2기존의 픽셀 기반 백도어 공격에 비해 주파수 도메인 백도어 공격는 성공률과 은폐성 측면에서 어떻게 비교되는가?
  • RQ3최신 방어 기법은 주파수 도메인 백도어 공격를 얼마나 잘 탐지하거나 완화할 수 있는가?
  • RQ4제안된 방어 기법의 한계는 무엇이며, 공격자는 이를 어떻게 우회할 수 있는가?
  • RQ5모델의 학습 용량은 주파수 도메인 백도어 임플리케이션의 가능성과 감지 가능성에 어떤 영향을 미치는가?

주요 결과

  • 주파수 도메인 백도어 공격는 여러 데이터셋과 네트워크 아키텍처에서 거의 완벽한 공격 성공률(100%에 가까운 수준)을 달성한다.
  • 기존 최신 방어 기법, 특히 신경 활성화 군집 및 기울기 기반 탐지기구에 대해 감지되지 않는다.
  • 주파수 필터링 기반 방어는 트리거를 필터링되지 않은 주파수 대역을 악용하도록 조정함으로써 우회할 수 있다.
  • 적대적 훈련 기반 방어는 주파수 도메인 트리거가 알려진 이상 패턴을 활성화하지 않도록 신중하게 설계된 경우 효과가 떨어진다.
  • 공격는 다양한 모델 아키텍처에 걸쳐 강력한 일반화 능력을 보이며 광범위한 적용 가능성을 시사한다.
  • 연구는 모델 용량이 백도어 임플리케이션의 임베딩 가능성과 감지 가능성에 결정적인 역할을 한다는 것을 드러내며, 더 큰 모델일수록 도청적인 주파수 기반 임플리케이션에 더 취약하다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.