Skip to main content
QUICK REVIEW

[논문 리뷰] Maximum Mean Discrepancy Test is Aware of Adversarial Attacks

Ruize Gao, Feng Liu|arXiv (Cornell University)|2020. 10. 22.
Integrated Circuits and Semiconductor Failure Analysis인용 수 17
한 줄 요약

이 논문은 의미 인식 기반 MMD(SAMMD) 검정을 제안하며, 깊이 있는 커널을 통합하고 점근적 통계 이론을 활용해 검정의 검정력을 극대화하며, 비i.i.d. 공격 데이터를 다루기 위해 월드 부트스트랩(bootstrapping)을 적용함으로써 최대 평균 차이(MMD) 검정을 향상시킨다. SAMMD 검정은 이전의 MMD 기반 방법들이 실패한 곳에서도 공격을 성공적으로 탐지하며, 핵심 요소들을 해결할 경우 MMD가 실제로 공격 분포를 인지할 수 있음을 입증한다.

ABSTRACT

The maximum mean discrepancy (MMD) test could in principle detect any distributional discrepancy between two datasets. However, it has been shown that the MMD test is unaware of adversarial attacks -- the MMD test failed to detect the discrepancy between natural and adversarial data. Given this phenomenon, we raise a question: are natural and adversarial data really from different distributions? The answer is affirmative -- the previous use of the MMD test on the purpose missed three key factors, and accordingly, we propose three components. Firstly, the Gaussian kernel has limited representation power, and we replace it with an effective deep kernel. Secondly, the test power of the MMD test was neglected, and we maximize it following asymptotic statistics. Finally, adversarial data may be non-independent, and we overcome this issue with the wild bootstrap. By taking care of the three factors, we verify that the MMD test is aware of adversarial attacks, which lights up a novel road for adversarial data detection based on two-sample tests.

연구 동기 및 목표

  • 이론적으로는 어떤 분포적 차이도 탐지할 수 있지만 이전의 MMD 검정이 공격을 탐지하지 못한 모순을 해결한다.
  • 이전 MMD 응용에서 간과된 세 가지 핵심 요소를 특정한다: 제한된 커널 표현력, 낮은 검정력, 비i.i.i.d. 공격 데이터.
  • 이 세 가지 제약을 동시에 해결하는 새로운 이중표본 검정을 개발하여 신뢰할 수 있는 공격 데이터 탐지 기능을 실현한다.
  • 적절한 커널과 통계 기법을 적용할 경우 MMD가 본질적으로 공격을 탐지할 수 있음을 입증한다.

제안 방법

  • 이미지 데이터의 표현력을 향상시키기 위해 표준 가우시안 커널 대신 의미 특징에서 학습된 깊이 있는 커널을 도입한다.
  • 점근적 통계 이론을 활용해 커널을 최적화함으로써 검정력을 극대화하여 분포 차이에 더 민감하게 반응하도록 한다.
  • 비독립적이고 동일분포가 아닌(non-i.i.d.) 공격 샘플을 다루기 위해 월드 부트스트랩 방법을 적용하여 타입 I 오류 제어를 보장한다.
  • 최적화된 깊이 있는 커널, 검정력 극대화 통계, 월드 부트스트랩을 통합한 의미 인식 기반 MMD(SAMMD) 검정을 구성한다.
  • 테스트 데이터의 일부를 대상으로 의미 인식 커널을 적응적으로 학습시켜 공격 분류기가 알려지지 않은 경우에도 효과성을 유지할 수 있도록 한다.
  • 검정 통계량을 공격하는 적응형 공격자(핵심 공격 및 공격-공격)를 시뮬레이션하기 위해 복합 공격 전략을 사용하여 탐지 성능을 평가한다.

실험 결과

연구 질문

  • RQ1이론적으로는 어떤 분포적 차이도 탐지할 수 있는데도 불구하고, 이전의 MMD 기반 방법들이 왜 공격을 탐지하지 못했는가?
  • RQ2커널 표현력, 검정력, 데이터 종속성의 한계를 해결함으로써 MMD 검정을 공격 데이터에 민감하게 만들 수 있는가?
  • RQ3의미 특징에서 학습된 깊이 있는 커널을 사용할 경우, 가우시안 커널이나 학습된 특징 커널 대비 공격 예측을 크게 향상시킬 수 있는가?
  • RQ4비i.i.d. 공격 데이터 존재 시 월드 부트스트랩 방법이 타입 I 오류 제어에 어떻게 기여하는가?
  • RQ5공격자가 탐지 메커니즘을 알고 있는 적응형 공격 상황에서도 SAMMD 검정은 여전히 강건한가?

주요 결과

  • 핵심 공격 하에서 미리 훈련된 ResNet-18 분류기를 89.08%의 성공률로 속이지만, SAMMD 검정은 이를 회피하여 강건성을 입증한다.
  • 공격-공격 전략은 분류기의 61.34%를 속였지만, SAMMD 검정은 여전히 공격 데이터의 특성을 성공적으로 탐지한다.
  • 직접 분류기를 공격하는 모델 공격 방법은 분류기의 100%를 속였지만, SAMMD 검정은 여전히 분포 이탈을 효과적으로 탐지한다.
  • 절단 실험 결과 의미 특징이 원시 특징(MMD-O+WB)과 학습된 특징(MMD-D+WB)보다 공격 데이터 탐지에서 뚜렷한 우월성을 보였다.
  • 월드 부트스트랩을 적용한 경우, 비i.i.d. 조건에서도 SAMMD 검정은 정상적인 타입 I 오류 비율(≤0.05)을 유지하며, 월드 부트스트랩 없이 MMD-O를 사용한 경우와는 대조된다.
  • SAMMD 검정은 FGSM, Square, PGD 등 다양한 공격 유형과 노이즈 수준에서도 공격 방법이 알려지지 않은 상황에서도 높은 검정력을 유지하며 공격을 탐지한다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.