Skip to main content
QUICK REVIEW

[논문 리뷰] Toward Adversarial Robustness via Semi-supervised Robust Training

Yiming Li, Baoyuan Wu|arXiv (Cornell University)|2020. 03. 16.
Adversarial Robustness in Machine Learning참고 문헌 50인용 수 5
한 줄 요약

이 논문은 표준 위험과 강건 위험을 동시에 최소화하여 적대적 방어 성능을 향상시키는 새로운 방식인 준감독 강건 훈련(Semi-supervised Robust Training, SRT)을 제안한다. 위험을 분리하고 레이블에 의존하지 않는 강건 위험을 활용하여 무 supervision 데이터를 효과적으로 활용함으로써, 픽셀 단위 및 공간 변형에 대한 공격에 대해 기존의 감독 학습 방법보다도 뛰어난 성능을 달성한다. 특히 레이블이 적은 경우에도 뛰어난 성능을 보이며, 최신 기술 수준을 초월한다.

ABSTRACT

Adversarial examples have been shown to be the severe threat to deep neural networks (DNNs). One of the most effective adversarial defense methods is adversarial training (AT) through minimizing the adversarial risk $R_{adv}$, which encourages both the benign example $x$ and its adversarially perturbed neighborhoods within the $\ell_{p}$-ball to be predicted as the ground-truth label. In this work, we propose a novel defense method, the robust training (RT), by jointly minimizing two separated risks ($R_{stand}$ and $R_{rob}$), which is with respect to the benign example and its neighborhoods respectively. The motivation is to explicitly and jointly enhance the accuracy and the adversarial robustness. We prove that $R_{adv}$ is upper-bounded by $R_{stand} + R_{rob}$, which implies that RT has similar effect as AT. Intuitively, minimizing the standard risk enforces the benign example to be correctly predicted, and the robust risk minimization encourages the predictions of the neighbor examples to be consistent with the prediction of the benign example. Besides, since $R_{rob}$ is independent of the ground-truth label, RT is naturally extended to the semi-supervised mode ($i.e.$, SRT), to further enhance the adversarial robustness. Moreover, we extend the $\ell_{p}$-bounded neighborhood to a general case, which covers different types of perturbations, such as the pixel-wise ($i.e.$, $x + δ$) or the spatial perturbation ($i.e.$, $ AX + b$). Extensive experiments on benchmark datasets not only verify the superiority of the proposed SRT method to state-of-the-art methods for defensing pixel-wise or spatial perturbations separately, but also demonstrate its robustness to both perturbations simultaneously. The code for reproducing main results is available at \url{https://github.com/THUYimingLi/Semi-supervised_Robust_Training}.

연구 동기 및 목표

  • 딥 네트워크가 다양한 종류의 변형 공격에 취약한 점을 해결하기 위해.
  • 감독 학습을 넘어서 무 supervision 데이터를 활용하여 적대적 강건성을 향상시키기 위해.
  • 픽셀 단위 및 공간 변형을 포함한 다양한 종류의 변형 공격에 일반화 가능한 통합된 방어 프레임워크를 개발하기 위해.
  • 적대적 위험에 대한 상한선을 통해 연속적인 위험 최소화의 효과를 이론적으로 입증하기 위해.
  • 레이블이 있는 데이터 외에도 무 supervision 데이터를 통해 강건성을 향상시킬 수 있음을 입증하고, 효율적인 준감독 학습을 가능하게 하기 위해.

제안 방법

  • 이 방법은 표준 위험 $ R_{\text{stand}} $ 과 강건 위험 $ R_{\text{rob}} $ 를 동시에 최소화하는 새로운 강건 훈련(RT) 목적함수를 도입한다. 여기서 $ R_{\text{rob}} $ 는 정상 예제와 그의 변형된 이웃들 사이의 예측 일관성을 측정한다.
  • 강건 위험 $ R_{\text{rob}} $ 는 모든 변형된 이웃에 대한 최대 0/1 손실로 정의되며, 진짜 레이블이 필요하지 않기 때문에 준감독 학습으로의 확장이 가능하다.
  • 논문은 적대적 위험 $ R_{\text{adv}} $ 가 $ R_{\text{stand}} + R_{\text{rob}} $ 의 상한선을 가진다는 것을 증명한다. 이는 RT가 적대적 훈련과 유사한 강건성을 확보함을 의미한다.
  • 거리 기반 이웃 정의를 사용하여 $ \ell_p $-유계 이웃을 더 넓은 범주로 일반화함으로써, 공간 변형 및 기능적 변형을 포함한 다양한 변형 유형을 다룰 수 있도록 한다.
  • 준감독 강건 훈련(SRT)은 $ R_{\text{rob}} $ 에 무 supervision 데이터를 통합하여, 이들 샘플에 대한 레이블이 없더라도 강건성을 크게 향상시킨다.
  • 다중 공격 유형을 동시에 고려하기 위해 일반화된 이웃 정의를 여러 종류의 변형에 동시에 적용함으로써 프레임워크를 복합 공격에 대비한 방어로 확장한다.

실험 결과

연구 질문

  • RQ1표준 적대적 훈련보다 표준 위험과 강건 위험을 동시에 최소화하는 것이 적대적 강건성을 더 효과적으로 향상시킬 수 있는가?
  • RQ2진짜 레이블에 의존하지 않는 강건 위험은 준감독 설정에서 효과적으로 활용되어 모델의 일반화 성능을 향상시킬 수 있는가?
  • RQ3$ \ell_p $-유계 픽셀 단위 변형을 넘어서 이웃 정의를 일반화하면 공간 변형과 같은 다양한 공격 유형에 대비한 방어가 가능한가?
  • RQ4SRT로 훈련된 단일 모델이 동시에 픽셀 단위 및 공간 변형 공격에 강건한가?
  • RQ5무 supervision 데이터의 사용은 강건 훈련에서 표준 정확도와 적대적 강건성 간의 상충 관계에 어떤 영향을 미치는가?

주요 결과

  • 10,000개의 레이블이 있는 MNIST 데이터와 50,000개의 무 supervision 데이터만을 사용하여 훈련한 SRT는 모든 60,000개의 레이블이 있는 Worst-of-k 모델보다 공간 공격에 대해 더 높은 적대적 정확도를 달성했다.
  • SRT의 적대적 정확도는 사용하는 무 supervision 데이터의 양이 증가할수록 계속 향상되며, 더 큰 데이터 풀을 활용할 경우 추가적인 성능 향상 가능성을 보여준다.
  • 시각화 결과 SRT는 더 평탄한 결정 경계와 더 높은 신뢰도 플랫폼을 생성함으로써, 작은 변형에 대해 강건한 이유를 설명한다.
  • SRT는 동시에 픽셀 단위 및 공간 변형 공격에 대해 최신 기술 수준의 방어 성능을 보이며, 통합된 강건성을 입증한다.
  • 이 방법은 픽셀 단위 및 공간 변형을 넘어서 블러링, 색상 이동 등의 다른 변형 유형에도 일반화 가능하며, 향후 확장 가능성에 기여한다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.