Skip to main content
QUICK REVIEW

[논문 리뷰] On the Certified Robustness for Ensemble Models and Beyond

Zhuolin Yang, Linyi Li|arXiv (Cornell University)|2021. 07. 22.
Adversarial Robustness in Machine Learning참고 문헌 60인용 수 7
한 줄 요약

이 논문은 다각도 정규화 훈련(DRT)을 제안하며, 이는 기저 모델 간의 다양한 기울기와 큰 신뢰도 마진을 촉진하여 앙상블 모델의 인증 가능 강건성을 향상시키는 경량 정규화 방법이다. DRT는 동일한 훈련 비용에서 MNIST, CIFAR-10, ImageNet에서 SOTA 수준의 $L_2$-강건성을 달성하며, 이전 앙상블 모델 대비 최대 6.1% 향상된 인증 정확도를 기록한다.

ABSTRACT

Recent studies show that deep neural networks (DNN) are vulnerable to adversarial examples, which aim to mislead DNNs by adding perturbations with small magnitude. To defend against such attacks, both empirical and theoretical defense approaches have been extensively studied for a single ML model. In this work, we aim to analyze and provide the certified robustness for ensemble ML models, together with the sufficient and necessary conditions of robustness for different ensemble protocols. Although ensemble models are shown more robust than a single model empirically; surprisingly, we find that in terms of the certified robustness the standard ensemble models only achieve marginal improvement compared to a single model. Thus, to explore the conditions that guarantee to provide certifiably robust ensemble ML models, we first prove that diversified gradient and large confidence margin are sufficient and necessary conditions for certifiably robust ensemble models under the model-smoothness assumption. We then provide the bounded model-smoothness analysis based on the proposed Ensemble-before-Smoothing strategy. We also prove that an ensemble model can always achieve higher certified robustness than a single base model under mild conditions. Inspired by the theoretical findings, we propose the lightweight Diversity Regularized Training (DRT) to train certifiably robust ensemble ML models. Extensive experiments show that our DRT enhanced ensembles can consistently achieve higher certified robustness than existing single and ensemble ML models, demonstrating the state-of-the-art certified L2-robustness on MNIST, CIFAR-10, and ImageNet datasets.

연구 동기 및 목표

  • 적대적 $L_2$ 변형 하에서 단일 모델보다 앙상블 모델이 더 높은 인증 가능 강건성을 달성할 수 있는지 조사하기.
  • 모델 부드러움 가정 하에 인증 가능 강건한 앙상블 모델을 위한 충분하고 필수 조건을 규명하기.
  • 지속적인 계산 비용 증가 없이 앙상블 모델의 인증 가능 강건성을 체계적으로 향상시키는 실용적인 훈련 방법 개발하기.
  • 특히 다양성과 마진을 최적화할 경우, 약한 조건에서도 앙상블 모델이 단일 모델을 능가하는 인증 가능 강건성을 달성할 수 있음을 검증하기.

제안 방법

  • 모델 부드러움을 보장하기 위해 '사전 스무딩 앙상블 전략'을 제안하여 앙상블 모델의 인증 가능 강건성 이론적 분석을 가능하게 한다.
  • 기본 모델 간 기울기 다양성을 촉진하고 예측 클래스 간 신뢰도 마진을 증가시키는 이중 정규화 손실인 DRT를 도입한다.
  • DRT는 가우시안 증강 및 적대적 훈련과 같은 기존 스무딩 기법과 유사하게 통합되며, 훈련 오버헤드를 거의 증가시키지 않는다.
  • 가중치 평균 및 평균 앙상블 프로토콜을 활용하며, 분석 결과 최적의 가중치는 균일 평균에 비해 근소한 성능 향상을 제공함을 확인하였다.
  • 이론적 분석을 통해 모델 부드러움 하에서 기울기 다양성과 큰 신뢰도 마진이 인증 가능 강건한 앙상블 모델을 위한 필수 및 충분 조건임을 증명하였다.
  • 기본 방어 기법으로 랜덤 스무딩을 사용하며, 인증 가능 강건성은 앙상블 구성원 간 스무딩 예측의 중앙값에서 유도된다.

실험 결과

연구 질문

  • RQ1적대적 $L_2$ 변형 하에서 앙상블 모델이 단일 모델보다 유의미하게 더 높은 인증 가능 강건성을 제공할 수 있는가?
  • RQ2모델 부드러움 가정 하에 인증 가능 강건한 앙상블 모델을 달성하기 위한 충분하고 필수 조건은 무엇인가?
  • RQ3앙상블 집계 프로토콜 선택(예: 평균 대비 가중치)이 인증 가능 강건성에 어떤 영향을 미치는가?
  • RQ4DRT와 같은 경량 정규화 방법이 다양한 데이터셋과 기초 모델에서 일관되게 인증 가능 강건성을 향상시킬 수 있는가?
  • RQ5기울기 다양성과 신뢰도 마진이 앙상블 모델의 인증 가능 강건성에 얼마나 기여하는가?

주요 결과

  • 균일 평균 또는 가중치 평균 집계를 사용하는 표준 앙상블 모델은 단일 모델 대비 인증 가능 강건성 향상이 근소미미하다. 예를 들어, CIFAR-10에서 $L_2$ 반경 1.5일 때 인증 정확도는 21.9%에서 24.2%로 뿐만 아니라 향상된다.
  • DRT로 훈련된 앙상블 모델은 CIFAR-10에서 $L_2$ 반경 1.5일 때 30.3%의 인증 정확도를 달성하며, 이는 이전 SOTA인 24.2%보다 유의미하게 향상된 성능이다.
  • $L_2$ 반경 2.0일 때 DRT는 인증 정확도를 20.3%로 향상시켰으며, 이는 CIFAR-10에서 이전 SOTA인 16.0%를 초월한다.
  • MNIST에서는 DRT가 반경 1.5일 때 76.7%의 인증 정확도를 기록하여, 동일한 조건에서 ADP(73.4%)와 GAL(73.2%)를 모두 능가한다.
  • 이론적 분석을 통해 모델 부드러움 하에서 기울기 다양성과 큰 신뢰도 마진이 인증 가능 강건한 앙상블 모델을 위한 필수 및 충분 조건임을 확인하였다.
  • DRT는 탄력적이며 사전 학습된 강건한 단일 모델과도 조합 가능하며, ImageNet에서 현재까지 보고된 바 중 가장 높은 인증 강건성을 달성한다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.