Skip to main content
QUICK REVIEW

[논문 리뷰] Online Adversarial Purification based on Self-Supervision

Changhao Shi, Chester Holtz|arXiv (Cornell University)|2021. 01. 23.
Adversarial Robustness in Machine Learning참고 문헌 33인용 수 12
한 줄 요약

이 논문은 재학습 없이 테스트 시점에 적응형 예측을 정제하는 자기지도 온라인 적대적 정제(Self-supervised Online Adversarial Purification, SOAP)를 제안한다. 훈련 중에 분류와 레이블에 의존하지 않는 자기지도 과제를 함께 최적화함으로써, SOAP은 추론 시점에 반복적이고 기울기 기반의 정제를 가능하게 하여, 최소한의 훈련 오버헤드로 강력한 적대적 공격에 대해 경쟁 가능한 내성 정확도를 달성하며, 적대자들이 방어 전략을 알고 있더라도 내성성을 유지한다.

ABSTRACT

Deep neural networks are known to be vulnerable to adversarial examples, where a perturbation in the input space leads to an amplified shift in the latent network representation. In this paper, we combine canonical supervised learning with self-supervised representation learning, and present Self-supervised Online Adversarial Purification (SOAP), a novel defense strategy that uses a self-supervised loss to purify adversarial examples at test-time. Our approach leverages the label-independent nature of self-supervised signals and counters the adversarial perturbation with respect to the self-supervised tasks. SOAP yields competitive robust accuracy against state-of-the-art adversarial training and purification methods, with considerably less training complexity. In addition, our approach is robust even when adversaries are given knowledge of the purification defense strategy. To the best of our knowledge, our paper is the first that generalizes the idea of using self-supervised signals to perform online test-time purification.

연구 동기 및 목표

  • 비감지 가능한 변형이 가해진 입력에서 잘못 분류되는 딥 네ural 네트워크의 취약성을 해결하기 위해.
  • 적대적 훈련의 계산 부담을 줄이기 위해 내성성을 테스트 시점 정제로 이관하기 위해.
  • 자기지도 신호가 레이블에 의존하지 않기 때문에, 적대적 변형을 탐지하고 역으로 복구하는 데 사용될 수 있는지 탐색하기 위해.
  • 적대자가 정제 메커니즘을 알고 있더라도 효과적인 방어를 유지할 수 있도록 설계하기 위해.
  • 이미지 전용 오토인코더나 GAN을 넘어서, 다양한 자기지도 사전 과제를 사용하여 적대적 정제를 일반화하기 위해.

제안 방법

  • 표준 훈련 중에 분류 헤드와 보조 자기지도 과제(예: 회전 예측, 대비 학습, 또는 재구성)를 함께 훈련한다.
  • 테스트 시점에, 분류기 입력을 고정한 채로 자기지도 손실을 최소화하기 위해 반복적 투영 경사 하강법(Projected Gradient Descent, PGD)을 적용하여 입력을 깨끗한 데이터 다양체로 정제한다.
  • 분류와 정제에 모두 동일한 인코더를 사용하여 두 작업에 동일한 표현을 사용함을 보장한다.
  • 적대적 공격을 위한 병합 목표함수를 정의하여 교차 엔트로피 손실과 보조 자기지도 손실을 함께 최적화함으로써, 방어 전략을 알고 있는 적대자가 공격하는 상황을 시뮬레이션한다.
  • 레이블 이동에는 불변하지만 적대적 노이즈로 인한 분포 이동에는 민감한 자기지도 과제를 선택하여 효과적인 변형 보정을 가능하게 한다.
  • 수렴할 때까지 반복적으로 정제 과정을 적용하며, 보조 손실을 정규화 요소로 사용하여 입력을 깨끗하고 자연스러운 표현으로 유도한다.

실험 결과

연구 질문

  • RQ1재학습이나 모델 피팅 없이도 자기지도 표현 학습을 사용해 테스트 시점에 적대적 예측을 정제할 수 있는가?
  • RQ2자기지도 신호의 레이블 독립성 덕분에 적대적 변형을 탐지하고 역으로 복구하는 데 효과적인가?
  • RQ3테스트 시점 정제 방법이 훈련 복잡도를 줄이며 최첨단 적대적 훈련 수준의 내성 정확도를 달성할 수 있는가?
  • RQ4적대자가 정제 메커니즘을 알고 있으며 공격을 그에 맞게 조정하더라도 방어가 여전히 효과적인가?
  • RQ5이 방법은 이미지 외의 다른 데이터 모odal리티로 일반화될 수 있으며, 적절한 자기지도 과제를 사용해 적용될 수 있는가?

주요 결과

  • SOAP은 MNIST와 CIFAR-10에서 경쟁 가능한 내성 정확도를 달성했으며, 특히 블랙박스 FGSM 공격 상황에서 표준 적대적 훈련을 뛰어넘었다.
  • FCN 아키텍처에서 SOAP-DR(재구성 기반)는 FGSM 블랙박스 공격 하에서 97.57%의 내성 정확도를 기록했으며, FGSM 적대적 훈련(79.76%)을 뛰어넘고 PGD 적대적 훈련(96.02%)에 가까이 다가섰다.
  • 적대자가 방어를 알고 있으며 분류 손실과 보조 손실 양쪽을 고려해 공격을 최적화할 경우, 특히 재구성 및 레이블 일관성 과제에서 공격 성공률이 감소했다.
  • 회전 예측 과제의 경우, 다양한 공격 무게 조정 파rameter에 대해 내성 정확도가 안정적으로 유지되어 다른 과제보다 이러한 공격에 더 민감한 것으로 나타났다.
  • 적대자가 대체 모델을 사용해 블랙박스 적대적 예측을 생성하더라도 이 방법은 강력한 성능을 유지하여 전이 기반 공격 시나리오에서도 내성성을 입증했다.
  • 테스트 시점 정제는 샘플당 거의 무시할 수 없는 계산 비용만 추가하므로 실세계 구현에 실용적이다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.