Skip to main content
QUICK REVIEW

[논문 리뷰] Thwarting Adversarial Examples: An $L_0$-RobustSparse Fourier Transform

Mitali Bafna, Jack Murtagh|arXiv (Cornell University)|2018. 12. 12.
Adversarial Robustness in Machine Learning인용 수 7
한 줄 요약

이 논문은 최악의 $L_0$ 노이즈에 대해 $L_0$-로버스트한 희소 푸리에 변환을 소개한다. 이는 유한한 수의 임의로 손상된 좌표를 가진 근사 희소 신호를 복원한다. 압축 감지 이론을 활용하여, 적대적 변형에 의해 손상된 청소된 이미지를 증명 가능하게 복원할 수 있으며, JSMA, CW 및 적대적 패치와 같은 강력한 $L_0$ 공격 하에서 MNIST, 패션-MNIST 및 ImageNet에서 신경망 정확도를 0%에서 85% 이상으로 복구한다.

ABSTRACT

We give a new algorithm for approximating the Discrete Fourier transform of an approximately sparse signal that has been corrupted by worst-case $L_0$ noise, namely a bounded number of coordinates of the signal have been corrupted arbitrarily. Our techniques generalize to a wide range of linear transformations that are used in data analysis such as the Discrete Cosine and Sine transforms, the Hadamard transform, and their high-dimensional analogs. We use our algorithm to successfully defend against well known $L_0$ adversaries in the setting of image classification. We give experimental results on the Jacobian-based Saliency Map Attack (JSMA) and the Carlini Wagner (CW) $L_0$ attack on the MNIST and Fashion-MNIST datasets as well as the Adversarial Patch on the ImageNet dataset.

연구 동기 및 목표

  • 최악의 $L_0$ 적대적 공격에 일반적인 방식으로 대응할 수 있는 방어 프레임워크를 개발하는 것 — 즉, 공격자가 입력 좌표의 유한한 수를 임의로 손상시킬 수 있다.
  • 희소 복원 기법을 압축 감지 이론에 기반하여, 최악의 $L_0$ 노이즈 하에서 신호 복원에 대한 이론적 보장을 제공하는 것.
  • DFT, DCT, DST 및 헤이드라드 변환을 포함한 광범위한 선형 변환 계열으로 방어 기법을 확장하여 신호 처리 및 컴퓨터 비전 분야에서 넓은 적용 가능성을 확보하는 것.
  • 제안된 변환을 통한 이미지 복원이 심각한 $L_0$ 공격 후에도 분류기 정확도를 복구할 수 있음을 보여주는 것 — 이는 공격 전략을 사전에 알지 못해도 된다.
  • 적대적 패치 및 물리적 차단과 같은 도전적인 실세계 $L_0$ 위협을 다루는 것 — 이 경우 노이즈는 연속적이며 푸리에 도메인에서 희소하다.

제안 방법

  • 반복적 하드 스레셔링(IHT) 기반의 새로운 $L_0$-로버스트한 희소 푸리에 변환을 제안하며, 푸리에 기저와 표준 기저에서 번갈아가며 희소 신호와 노이즈를 추정한다.
  • IHT 알고리즘을 사용하여 $t$-희소 $L_0$ 노이즈에 의해 손상된 신호의 상위-$k$ 푸리에 계수를 복원하며, 고정된 반복 횟수 $T$를 사용한다.
  • 연속적 노이즈(예: 적대적 패치)의 경우, 잔차의 푸리에 도메인 희소도를 최소화하는 방식으로 $\
  • 자연 이미지가 DCT나 DFT 도메인에서 근사 희소성을 띠므로, 효과적인 압축과 복원을 가능하게 하는 푸리에 기저를 희소성 도메인으로 사용한다.
  • 두 단계 반복 프로세스를 적용한다: (1) 상위-$k$ 계수에 대한 하드 스레셔닝을 통해 푸리에 도메인에서 신호를 추정하고, (2) 잔차의 상위-$t$ 성분에 대한 하드 스레셔닝을 통해 표준 기저에서 노이즈를 추정한다.
  • 이론적 기반은 압축 감지에서 유래하며, 변환 행렬의 약한 희소성 및 비정규성 조건 하에서 복원 보장을 보장한다.

실험 결과

연구 질문

  • RQ1최악의 $L_0$ 노이즈에 대해 공격자가 유한한 수의 좌표를 임의로 손상시킬 수 있을 때, 희소 푸리에 변환을 이에 대비해 강건하게 만들 수 있는가?
  • RQ2이러한 강건한 변환은 실생활 신호 처리에서 널리 사용되는 DCT, DST 및 헤이드라드 변환과 같은 다른 선형 변환으로 일반화될 수 있는가?
  • RQ3JSMA 및 CW와 같은 강력한 $L_0$ 공격 후에도, 정확도가 근처 0%로 떨어졌을 때 제안된 방법이 분류기 정확도를 복구할 수 있는가?
  • RQ4전체 이미지 복원이 불가능한 상황에서, 적대적 패치와 같은 연속적 $L_0$ 노이즈를 탐지하고 수정할 수 있는가?
  • RQ5공격 전략을 사전에 알지 못해도, 원래 신호가 변환 도메인에서 희소성을 띠는 것으로만 기반하여 방어가 작동할 수 있는가?

주요 결과

  • MNIST 데이터셋에서 30픽셀의 $L_0$ 공격 시, 네트워크 정확도는 88.5%에서 24.8%로 떨어졌지만, 보정 알고리즘 적용 후 83.1%로 복구되었다.
  • 적응적 예산을 가진 더 공격적인 $L_0$ 공격 하에서 정확도는 87.8%에서 0%로 떨어졌지만, 제안된 방법으로 85.7%로 복구되었다.
  • ImageNet에서의 적대적 패치 공격 시, Top-1 정확도는 패치 적용 후 76.4%에서 12.0%로 떨어졌지만, 보정 후 59.7%로 회복되었다.
  • ImageNet에서의 Top-5 정확도는 패치 적용 후 63.9%에서 보정 후 80.4%로 향상되었으며, 보정된 이미지 중 4.7%만 '토스터'로 잘못 분류되었다.
  • Patchwise IHT 알고리즘은 푸리에 도메인에서 잔차의 희소도가 가장 낮은 블록을 식별하여 적대적 패치를 성공적으로 탐지하고 수정하였다.
  • 압축 감지 가정 하에서 증명 가능한 복원 보장을 달성하여, 공격 전략을 알지 못해도 최악의 $L_0$ 적대자에 대해 강건한 방어를 구현할 수 있다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.