Skip to main content
QUICK REVIEW

[논문 리뷰] Adversarial Training with Rectified Rejection

Tianyu Pang, Huishuai Zhang|arXiv (Cornell University)|2021. 09. 29.
Adversarial Robustness in Machine Learning참고 문헌 111인용 수 8
한 줄 요약

이 논문은 신뢰도 교정을 통해 진정한 신뢰도(T-Con) — 정답 클래스에 대한 모델의 예측 확률 — 를 예측하도록 학습하는 모듈인 Rectified Rejection(RR)을 제안한다. R-Con(교정된 신뢰도)와 거부기(rejector)를 결합함으로써, RR은 적응적 공격 하에서도 오분류된 입력과 올바르게 분류된 입력을 효과적으로 구분하며, 최소한의 계산 부담으로 높은 내성 정확도를 달성한다.

ABSTRACT

Adversarial training (AT) is one of the most effective strategies for promoting model robustness, whereas even the state-of-the-art adversarially trained models struggle to exceed 60% robust test accuracy on CIFAR-10 without additional data, which is far from practical. A natural way to break this accuracy bottleneck is to introduce a rejection option, where confidence is a commonly used certainty proxy. However, the vanilla confidence can overestimate the model certainty if the input is wrongly classified. To this end, we propose to use true confidence (T-Con) (i.e., predicted probability of the true class) as a certainty oracle, and learn to predict T-Con by rectifying confidence. We prove that under mild conditions, a rectified confidence (R-Con) rejector and a confidence rejector can be coupled to distinguish any wrongly classified input from correctly classified ones, even under adaptive attacks. We also quantify that training R-Con to be aligned with T-Con could be an easier task than learning robust classifiers. In our experiments, we evaluate our rectified rejection (RR) module on CIFAR-10, CIFAR-10-C, and CIFAR-100 under several attacks, and demonstrate that the RR module is well compatible with different AT frameworks on improving robustness, with little extra computation.

연구 동기 및 목표

  • 추가 데이터 없이 CIFAR-10에서 일반적으로 60%를 초과하지 못하는 적응적 훈련 모델의 지속적인 정확도 한계를 해결하기 위해.
  • 기본적인 신뢰도가 잘못 분류된 입력에서 모델의 확신도를 과대평가할 수 있는 한계를 극복하기 위해.
  • 거부 결정을 위한 더 신뢰할 만한 확신 지표로 진정한 신뢰도(T-Con)를 예측하는 방법을 제안하기 위해.
  • 교정된 신뢰도를 사용하여 적응적 공격 하에서도 잘못 분류된 입력과 올바르게 분류된 입력을 구분할 수 있는 거부기를 설계하기 위해.

제안 방법

  • 진정한 클래스의 예측 확률로 정의되는 이상적인 확신 지표로 진정한 신뢰도(T-Con)를 도입한다.
  • T-Con의 더 정확한 추정치를 학습하기 위해 신뢰도 교정을 제안하며, 이를 교정된 신뢰도(R-Con)라 칭한다.
  • R-Con을 사용하여 오분류될 가능성이 높은 입력을 식별하고 거부하는 거부기를 설계한다. 이는 적응적 공격 하에서도 효과적이다.
  • 약한 조건 하에서, 결합된 R-Con 거부기와 신뢰도 거부기가 잘못 분류된 입력과 올바르게 분류된 입력을 항상 구분할 수 있음을 증명한다.
  • T-Con과 일치하도록 R-Con 모듈을 훈련시키며, 이는 완전히 내성적인 분류기를 훈련시키는 것보다 더 단순한 학습 목표임을 보여준다.
  • RR 모듈을 기존의 적응적 훈련 프레임워크에 최소한의 계산 비용으로 통합한다.

실험 결과

연구 질문

  • RQ1교정된 신뢰도 예측기는 적응적 훈련 모델에서 거부 결정의 신뢰성을 향상시킬 수 있는가?
  • RQ2적응적 공격 하에서도 R-Con을 사용하여 오분류된 입력과 올바르게 분류된 입력을 구분할 수 있는가?
  • RQ3교정을 통해 T-Con을 예측하는 것이 표준 적응적 훈련만으로는 더 높은 내성성을 달성하는 데 기여하는가?
  • RQ4R-Con을 학습시키는 난이도는 내성적인 분류기를 학습시키는 것보다 어때?
  • RQ5RR 모듈은 추가적인 계산 비용 없이 다양한 AT 프레임워크와 효과적으로 통합될 수 있는가?

주요 결과

  • RR 모듈은 다양한 적응적 공격 하에서 CIFAR-10, CIFAR-10-C, CIFAR-100에서 뚜렷이 향상된 내성 테스트 정확도를 달성한다.
  • 신뢰할 수 있는 R-Con 지표 덕분에, 적응적 공격 하에서도 오염된 입력을 효과적으로 거부할 수 있다.
  • T-Con과 일치하도록 R-Con 모듈을 훈련시키는 것은 완전히 내성적인 분류기를 훈련시키는 것보다 경험적으로 더 쉽다.
  • RR 모듈은 다양한 적응적 훈련 프레임워크와 호환되며, 최소한의 추가 계산 비용을 유발한다.
  • 약한 가정 하에, 결합된 R-Con과 신뢰도 거부기 시스템은 모든 잘못 분류된 입력을 올바르게 분류된 입력과 구분할 수 있다.
  • 경험적 결과는 RR이 추가 데이터나 주요 아키텍처 변경 없이도 내성성을 향상시킨다는 것을 확인한다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.