Skip to main content
QUICK REVIEW

[논문 리뷰] Towards Defending against Adversarial Examples via Attack-Invariant Features

Dawei Zhou, Tongliang Liu|arXiv (Cornell University)|2021. 06. 09.
Adversarial Robustness in Machine Learning인용 수 15
한 줄 요약

이 논문은 다양한 적대적 공격에 걸쳐 공격에 영향을 받지 않는 특징(공격에 불변한 특징, AIFs)을 학습함으로써 자연 입력을 복원하는 적대적 노이즈 제거 네트워크(ARN)를 제안한다. 적대적 특징 학습을 통해 AIFs를 분리하고 잠재 공간을 정규화하여 편향을 줄임으로써 ARN은 특히 알려지지 않은 공격 및 적응형 공격에 대해 뛰어난 강건성을 확보하며, 픽셀 및 공간 제약이 있는 공격에서 CIFAR-10과 MNIST에서 최신 기법들을 능가한다.

ABSTRACT

Deep neural networks (DNNs) are vulnerable to adversarial noise. Their adversarial robustness can be improved by exploiting adversarial examples. However, given the continuously evolving attacks, models trained on seen types of adversarial examples generally cannot generalize well to unseen types of adversarial examples. To solve this problem, in this paper, we propose to remove adversarial noise by learning generalizable invariant features across attacks which maintain semantic classification information. Specifically, we introduce an adversarial feature learning mechanism to disentangle invariant features from adversarial noise. A normalization term has been proposed in the encoded space of the attack-invariant features to address the bias issue between the seen and unseen types of attacks. Empirical evaluations demonstrate that our method could provide better protection in comparison to previous state-of-the-art approaches, especially against unseen types of attacks and adaptive attacks.

연구 동기 및 목표

  • 학습 시 볼 수 있었던 공격에 대해서는 잘 작동하지만, 알려지지 않은 공격이나 적응형 공격에 대해서는 실패하는 적대적 방어의 일반화 갭을 해소한다.
  • 학습 중 공격 유형의 분포가 불균형해 발생하는 학습된 특징의 편향을 해소한다.
  • 다양한 공격 간에 변하지 않는 의미적 특징을 추출하여 자연 예측을 복원하는 사전 처리 방어 기법을 개발한다.
  • 픽셀 제약 및 공간 제약이 있는 공격에 대해 강건성을 향상시키며, 특히 사전에 볼 수 없었던 공격 유형에 대해 유의미하게 개선한다.
  • 추론 시 타겟 모델의 아키텍처나 기울기 정보에 접근할 필요 없이 효과적인 방어를 가능하게 한다.

제안 방법

  • 쌍체 인코더와 디코더를 갖춘 오토인코더 기반 ARN 프레임워크를 제안하여, 적대적 노이즈에서 공격에 불변한 특징(AIFs)을 분리한다.
  • 적대적 특징 학습을 활용: 디코더는 공격 유형에 따라 달라지는 정보(예: 공격 유형)를 인코딩된 AIF 공간에서 구분하도록 학습하며, 동시에 인코더는 디코더의 관점에서 구분이 불가능한 특징을 학습한다.
  • AIF 잠재 공간에 정규화 항목을 도입하여 특징 분포를 다변량 정규분포 사전분포와 일치시켜, 볼 수 있었던 공격과 볼 수 없었던 공격 간의 편향을 줄인다.
  • 디코더를 최적화하여 합성 예측값과 원본 자연 입력 간의 픽셀 단위 재구성 오차를 최소화함으로써 깨끗한 데이터의 정확한 복원을 가능하게 한다.
  • 인코더와 디코더를 동시에 최적화하여 의미 정보를 유지하면서도 적대적 페르튜베이션을 제거하는 강건하고 일반화 가능한 AIFs를 학습한다.
  • 학습 시 여러 공격 유형(PGD, AA, STA 등)을 활용하여 알려지지 않은 공격의 커버리지와 일반화 능력을 향상시킨다.

실험 결과

연구 질문

  • RQ1다양한 적대적 공격에 걸쳐 공격에 불변한 특징(AIFs)을 효과적으로 학습할 수 있는가?
  • RQ2AIF 잠재 공간의 정규화가 볼 수 있었던 공격과 볼 수 없었던 공격 간의 편향을 어떻게 완화하는가?
  • RQ3ARN은 학습 중에 볼 수 없었던 공격 및 적응형 공격에 얼마나 잘 일반화되는가?
  • RQ4AIFs를 통해 적대적 노이즈를 제거한 복원 예측값이 탐지 모델에 의해 자연 예측값과 구분되지 않는가?
  • RQ5다양한 공격 유형과 제약 조건에서 ARN은 최신 기법들과 비교해 강건성 정확도 측면에서 어떻게 성능을 내는가?

주요 결과

  • ARN은 CIFAR-10에서 최신 기법을 능가하는 최고 수준의 강건성 정확도를 확보하였으며, 알려지지 않은 AutoAttack(AC N)에 대해 88.7%, PGD N에 대해 86.9%, 공간 변환 공격(STA N)에 대해 85.1%의 정확도를 기록하여 기존 방법들을 크게 앞서 간다.
  • 절단 실험을 통해 정규화 손실($\mathcal{L}_{nor}$)을 제거할 경우 강건성이 급격히 떨어짐—예를 들어 알려지지 않은 STA N에 대한 정확도가 85.1%에서 64.3%로 감소—정규화 손실이 일반화에 결정적인 역할을 함을 입증한다.
  • 공격에 불변한 특징 학습 손실($\mathcal{L}_{att}$)을 제거할 경우 ARN의 강건성이 붕괴되며, 알려지지 않은 공격에 대해 정확도가 50% 이하로 떨어짐—이를 통해 AIFs를 분리하기 위해 필수적인 요소임을 입증한다.
  • 국소 내재 차원성(LID)을 통한 적대적 예측 탐지 결과, 복원된 예측값에 대해 MNIST에서는 1.26%의 재현율, CIFAR-10에서는 8.48%의 재현율을 기록하여 자연 데이터와 거의 구분되지 않음을 시사한다.
  • 모델은 크로스 모델 방어에 대해 잘 일반화됨: ARN 전처리를 거친 예측값은 다른 타겟 모델에서도 높은 강건성을 유지함으로써 사전 처리 기법의 효과를 확인한다.
  • 적응형 공격에 대해서도 모델은 강건성을 유지함으로써 AIFs가 진화하는 공격 전략의 페르튜베이션 패tern에 저항하는 의미적 불변성을 캡처함을 입증한다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.