Skip to main content
QUICK REVIEW

[논문 리뷰] Adversarial Defense by Suppressing High-frequency Components

Zhendong Zhang, Cheolkon Jung|arXiv (Cornell University)|2019. 08. 19.
Adversarial Robustness in Machine Learning참고 문헌 4인용 수 8
한 줄 요약

이 논문은 적대적 공격에 대한 딥 네ural 네트워크의 강건성을 향상시키기 위해 이산 푸리에 변환(DFT) 기반의 미분 가능 고주파 성분 억제 모듈을 제안한다. 이는 적대적 편향이 악용하는 고주파 성분을 걸러내는 방식이다. 이 방법은 고주파 억제, 적대적 훈련(TRADES), 및 모델 앙상블의 조합을 통해 IJCAI-2019 알리바바 적대적 AI 챌린지에서 19.7531점으로 5위를 기록했다.

ABSTRACT

Recent works show that deep neural networks trained on image classification dataset bias towards textures. Those models are easily fooled by applying small high-frequency perturbations to clean images. In this paper, we learn robust image classification models by removing high-frequency components. Specifically, we develop a differentiable high-frequency suppression module based on discrete Fourier transform (DFT). Combining with adversarial training, we won the 5th place in the IJCAI-2019 Alibaba Adversarial AI Challenge. Our code is available online.

연구 동기 및 목표

  • 고주파 편향을 악용하는 적대적 공격에 취약한 딥 네럴 네트워크의 문제를 해결한다.
  • 청정 이미지는 저주파 성분에 에너지가 집중되어 있는 반면, 적대적 편향은 주로 고주파 성분임을 관찰한다.
  • 청정 이미지 표현을 손상시키지 않으면서도 고주파 성분을 억제하는 강건하고 효율적이며 미분 가능한 이미지 전처리 모듈을 개발한다.
  • 적대적 훈련과 모델 앙상블과의 공동 최적화를 통해 모델의 강건성을 향상시킨다.
  • 주파수 도메인 필터링이 실제 적대적 도전 과제에서 방어 수단으로 효과적인지 입증한다.

제안 방법

  • 입력 이미지를 주파수 도메인으로 변환하기 위해 이산 푸리에 변환(DFT)을 적용한다.
  • 반지름 r인 상자 창 마스크 𝒫를 사용하여 고주파 성분을 억제(0으로 설정)하고 저주파 성분을 유지(1로 설정)한다.
  • 주파수 필터링 후 역푸리에 변환을 적용하여 공간 도메인에서 이미지를 재구성함으로써, 미분 가능한 모듈을 형성한다: x ← F⁻¹(𝒫 ⊙ F(x)).
  • 고주파 억제 모듈을 DNN 아키텍처에 통합하여 적대적 예제와 함께 엔드 투 엔드 훈련을 가능하게 한다.
  • TRADES를 사용한 적대적 훈련과 함께 이 모듈을 조합하여 청정 정확도와 강건성을 동시에 최적화한다.
  • 다양한 억제 반지름 r을 가진 여러 모델을 앙상블하여 더 높은 강건성을 확보한다.

실험 결과

연구 질문

  • RQ1주파수 도메인에서 고주파 성분을 억제하면 딥 네럴 네트워크의 적대적 공격에 대한 강건성이 향상되는가?
  • RQ2미분 가능하고 효율적이며 제어 가능한 고주파 억제 모듈이 적대적 훈련과 조합되었을 때 더 나은 방어 성능을 제공하는가?
  • RQ3고주파 억제 수준(r로 제어)에 따라 청정 정확도와 강건성 간의 트레이드오프는 어떻게 변화하는가?
  • RQ4실제 적대적 도전 과제에서 표준 적대적 훈련보다 주파수 도메인 필터링이 더 효과적인가?
  • RQ5고주파 억제의 성능 향상 효과는 적대적 훈련 및 모델 앙상블과 상호보완적인가?

주요 결과

  • 청정 이미지는 저주파 영역에 집중된 스펙트럼 에너지를 보이며, 반면 적대적 편향은 거의 균일한 에너지 분포를 가진다.
  • 상자 창 마스크를 사용한 고주파 억제는 적대적 편향의 영향을 효과적으로 감소시키지만, 청정 이미지의 대부분의 구조적 정보를 유지한다.
  • 제안된 고주파 억제 모듈은 미분 가능하며, 복잡도가 O(MN log M)로 효율적이고, 상자 창의 반지름 r을 통해 제어 가능하다.
  • 적대적 훈련 없이 고주파 억제만을 사용할 경우, r가 감소할수록 강건성이 크게 향상되었지만, 청정 정확도는 떨어졌다.
  • 고주파 억제를 적대적 훈련(TRADES)과 모델 앙상블과 조합함으로써 최고의 성능을 달성했으며, IJCAI-2019 알리바바 적대적 AI 챌린지에서 19.7531점으로 5위를 기록했다.
  • 이 방법은 단독으로 적용된 적대적 훈련이나 고주파 억제보다 뛰어난 성능을 보였으며, 상호보완적 이점을 입증했다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.