Skip to main content
QUICK REVIEW

[논문 리뷰] Exploiting the Inherent Limitation of L0 Adversarial Examples

Fei Zuo, Bokai Yang|arXiv (Cornell University)|2018. 12. 23.
Adversarial Robustness in Machine Learning참고 문헌 44인용 수 4
한 줄 요약

이 논문은 $L_0$ 적대적 예제를 탐지하고 수정하기 위해 그 본질적 한계인 최소한의 픽셀 손상과 고강도 변형을 활용하는 새로운 방어 시스템 AEPecker를 제안한다. 이 방법은 원본 이미지와 인painting 처리된 버전을 비교하기 위해 시아모이 네트워크를 사용하여, 잘못 분류된 입력을 고정밀도로 탐지하고 효과적으로 수정한다.

ABSTRACT

Despite the great achievements made by neural networks on tasks such as image classification, they are brittle and vulnerable to adversarial example (AE) attacks, which are crafted by adding human-imperceptible perturbations to inputs in order that a neural-network-based classifier incorrectly labels them. In particular, L0 AEs are a category of widely discussed threats where adversaries are restricted in the number of pixels that they can corrupt. However, our observation is that, while L0 attacks modify as few pixels as possible, they tend to cause large-amplitude perturbations to the modified pixels. We consider this as an inherent limitation of L0 AEs, and thwart such attacks by both detecting and rectifying them. The main novelty of the proposed detector is that we convert the AE detection problem into a comparison problem by exploiting the inherent limitation of L0 attacks. More concretely, given an image I, it is pre-processed to obtain another image I' . A Siamese network, which is known to be effective in comparison, takes I and I' as the input pair to determine whether I is an AE. A trained Siamese network automatically and precisely captures the discrepancies between I and I' to detect L0 perturbations. In addition, we show that the pre-processing technique, inpainting, used for detection can also work as an effective defense, which has a high probability of removing the adversarial influence of L0 perturbations. Thus, our system, called AEPECKER, demonstrates not only high AE detection accuracies, but also a notable capability to correct the classification results.

연구 동기 및 목표

  • 큰 강도의 희박한 변형으로 인해 제거가 어려운 $L_0$ 적대적 예제를 탐지하고 방어하는 데 도전한다.
  • 특성 압축 또는 압축 기반 방식에 의존하는 기존 방어 기법이 $L_0$ 공격에 실패하는 한계를 극복한다.
  • $L_0$ AEs의 본질적 구조적 특성인 희박하고 고강도의 픽셀 수정을 활용하여 강력한 탐지 및 수정 메커니즘을 설계한다.
  • 높은 정확도로 $L_0$ AEs를 탐지할 뿐 아니라, 이를 수정하여 정확한 분류를 복원하는 방어 시스템을 개발한다.
  • 기존 방어 기법을 우회하는 적응형 공격에 대한 제안된 방법의 내성을 입증한다.

제안 방법

  • 입력 이미지 $I$를 인painting 기반 기법으로 사전 처리하여, $L_0$ AEs의 특징인 고강도의 고립된 변형을 제거한 수정된 이미지 $I'$를 생성한다.
  • 이미지 쌍 $(I, I')$을 시아모이 신경망에 입력하여 두 이미지를 비교하고 $I$가 적대적 예제인지 여부를 판단한다.
  • 시아모이 네트워크가 이미지 간의 미세한 차이를 학습할 수 있는 능력을 활용하여 $L_0$ 변형을 정밀하게 탐지한다.
  • 동일한 인painting 사전 처리 단계를 방어 수단으로 활용하여 적대적 영향을 제거하고 모델 예측을 정상 상태로 복원한다.
  • 실제 정상 이미지와 $L_0$ 적대적 예제를 기반으로 시아모이 네트워크를 엔드 투 엔드로 훈련하여 탐지에 유의미한 특징를 학습한다.
  • 표준 벤치마크와 Carlini-Wagner $L_0$ (CW-$L_0$)와 같은 적대적 공격을 사용하여 시스템을 검증하여 적응형 공격에 대한 강건성을 입증한다.

실험 결과

연구 질문

  • RQ1사용자 정의된 $L_0$ 적대적 예제의 본질적 구조적 한계인 희박하고 고강도의 픽셀 손상은 더 효과적인 탐지 기법을 설계하는 데 활용될 수 있는가?
  • RQ2원본 이미지와 인painting 처리된 버전을 비교함으로써 시아모이 네트워크 아키텍처가 $L_0$ 적대적 예제를 효과적으로 탐지할 수 있는가?
  • RQ3인painting 사전 처리 단계는 탐지 외에도 $L_0$ 적대적 예제를 수정하여 정확한 분류를 복원할 수 있는가?
  • RQ4기존의 방어 기법인 특성 압축 또는 압축 기반 방어를 우회하는 적응형 공격에 대해 제안된 방법은 어떻게 성능을 발휘하는가?
  • RQ5이 시스템의 탐지 및 수정 능력은 다양한 신경망 아키텍처와 데이터셋 간에도 일반화 가능한가?

주요 결과

  • 원본 이미지와 인painting 처리된 이미지 간의 구조적 차이를 활용하여, 시아모이 네트워크 기반 탐지기가 $L_0$ 적대적 예제에 대해 높은 탐지 정확도를 달성한다.
  • 인painting 기반 사전 처리 단계는 큰 강도의 희박한 변형을 효과적으로 제거하여 $L_0$ 적대적 예제에서의 분류 정확도를 크게 향상시킨다.
  • AEPecker는 특성 압축 및 압축 기반 방어를 우회하는 적응형 공격에 대해서도 내성을 보이며, 강건성을 입증한다.
  • 특히 잘못 분류된 예측을 수정하는 데 있어, 기존의 JPEG 압축, PCA, 특성 압축과 같은 방어 기법보다 뛰어난 성능을 보인다.
  • ResNet 및 CNN과 같은 다양한 기본 분류기에서 높은 성능을 유지하여 일반화 가능성을 확인한다.
  • 연구 결과, $L_0$ 공격는 변형 강도를 제어할 수 없기 때문에 본질적으로 한계를 지닌다는 점을 확인하였으며, 이는 탐지 및 수정에 활용될 수 있다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.