Skip to main content
QUICK REVIEW

[논문 리뷰] MixTrain: Scalable Training of Verifiably Robust Neural Networks

Shiqi Wang, Yizheng Chen|arXiv (Cornell University)|2018. 11. 06.
Adversarial Robustness in Machine Learning인용 수 10
한 줄 요약

MixTrain는 $L_\infty$-bounded 공격에 대해 95.2%의 검증 가능 강건성 정확도를 달성하면서도 훈련을 최대 15배 빠르게 하는 두 가지 새로운 기법—스티오스틱 강건 근사와 동적 혼합 훈련—을 도입한다. 이는 ImageNet-200에서 훈련된 대규모 모델에 대해서도 확장 가능한 검증 가능 강건성 훈련을 가능하게 하며, 속도, 정확도, 강건성 측면에서 이전의 적대적 및 검증 가능 강건 훈련 방법들을 모두 능가한다.

ABSTRACT

Making neural networks robust against adversarial inputs has resulted in an arms race between new defenses and attacks. The most promising defenses, adversarially robust training and verifiably robust training, have limitations that restrict their practical applications. The adversarially robust training only makes the networks robust against a subclass of attackers and we reveal such weaknesses by developing a new attack based on interval gradients. By contrast, verifiably robust training provides protection against any L-p norm-bounded attacker but incurs orders of magnitude more computational and memory overhead than adversarially robust training. We propose two novel techniques, stochastic robust approximation and dynamic mixed training, to drastically improve the efficiency of verifiably robust training without sacrificing verified robustness. We leverage two critical insights: (1) instead of over the entire training set, sound over-approximations over randomly subsampled training data points are sufficient for efficiently guiding the robust training process; and (2) We observe that the test accuracy and verifiable robustness often conflict after certain training epochs. Therefore, we use a dynamic loss function to adaptively balance them for each epoch. We designed and implemented our techniques as part of MixTrain and evaluated it on six networks trained on three popular datasets including MNIST, CIFAR, and ImageNet-200. Our evaluations show that MixTrain can achieve up to $95.2\%$ verified robust accuracy against $L_\infty$ norm-bounded attackers while taking $15$ and $3$ times less training time than state-of-the-art verifiably robust training and adversarially robust training schemes, respectively. Furthermore, MixTrain easily scales to larger networks like the one trained on ImageNet-200, significantly outperforming the existing verifiably robust training methods.

연구 동기 및 목표

  • 검증 가능 강건 훈련의 높은 계산 및 메모리 오버헤드로 인해 이는 작은 네트워크에만 국한되어 사용되는 문제를 해결한다.
  • 훈련 중에 테스트 정확도와 검증 가능 강건성 간의 갈등을 해결하기 위해 두 목표를 동적으로 균형 조절한다.
  • 이전 방법이 처리하지 못했던 ImageNet-200와 같은 대규모 모델에 대해 확장 가능하고 검증 가능한 강건 훈련을 가능하게 한다.
  • 적대적 강건 네트워크가 새로운 공격, 예를 들어 간격 기울기 공격에 얼마나 근본적으로 취약한지를 보여주어 검증 가능한 방어의 필요성을 정당화한다.
  • 기존의 강건 훈련 방법들보다 훈련 시간과 메모리 사용을 크게 줄이며, 최신 기술 수준의 검증 가능 강건 정확도를 달성한다.

제안 방법

  • 스티오스틱 강건 근사 기법은 각 훈련 에포크 동안 전체 데이터셋이 아닌 무작위로 추출된 미니배치에서만 강건성 위반의 타당한 초과 근사를 계산하여 훈련 비용을 절감한다.
  • 동적 혼합 훈련은 학습 가능한 하이퍼파ram터 $\alpha$를 통해 표준 크로스 엔트로피 손실과 강건 손실을 동적으로 균형 조절하는 적응형 손실 함수를 사용한다. 이 $\alpha$는 각 에포크마다 업데이트되어 테스트 정확도와 검증 가능 강건 정확도 사이의 트레이드오���을 최적화한다.
  • 이 방법은 전체 데이터셋에 대한 초과 근사를 훈련 중 기울기 기반 최적화에는 필요로 하지 않으며, 오직 최종 강건성 검증 시에만 필요하다는 통찰을 활용한다.
  • 적응형 $\alpha$ 메커니즘은 훈련이 진행됨에 따라 손실 가중치를 동적으로 조정하여 강건성을 우선시함으로써, 고정된 가중치 방식이 야기하는 정확도-강건성 트레이드오프 문제를 피한다.
  • 이 프레임워크는 MixTrain로 구현되어 MNIST, CIFAR, ImageNet-200에서 여섯 개의 네트워크에 대해 평가되었으며, 검증을 위해 $L_\infty$-노름 기반 공격을 사용하였다.
  • 적대적 강건 훈련의 한계를 드러내기 위해 새로운 일阶 간격 기울기 공격을 제안하였으며, 이는 검증 가능한 방어의 필요성을 검증한다.

실험 결과

연구 질문

  • RQ1ImageNet-200에서 훈련된 대규모 신경망에 대해 검증 가능 강건 훈련을 계산 비용이 과도하지 않게 확장할 수 있는가?
  • RQ2미니배치에만 초과 근사를 적용하는 스티오스틱 강건 근사는 강건 훈련 과정을 안내하는 데 충분한 정확도를 유지하는가?
  • RQ3적응형 $\alpha$를 사용한 동적 손실 가중치 조정은 고정된 가중치 훈련에 비해 테스트 정확도와 검증 가능 강건 정확도 사이의 균형을 향상시킬 수 있는가?
  • RQ4MixTrain는 최신 기술 수준의 적대적 강건 및 검증 가능 강건 훈련 방법에 비해 성능과 효율성 측면에서 어떻게 비교되는가?
  • RQ5현재 배포된 적대적 강건 네트워크가 방어를 우회하는 새로운 공격, 예를 들어 간격 기울기 공격에 얼마나 취약한가?

주요 결과

  • MixTrain는 CIFAR-10에서 $L_\infty$-노름 기반 공격에 대해 최대 95.2%의 검증 가능 강건 정확도를 달성하며, 이는 이전의 검증 가능 강건 훈련 방법들을 크게 능가한다.
  • MixTrain는 최신 기술 수준의 검증 가능 강건 훈련 대비 최대 15배 빠른 훈련 시간을 기록했으며, 적대적 강건 훈련 대비 최대 3배 빠르게 하면서도 테스트 정확도를 유지하거나 향상시켰다.
  • 기존의 검증 가능 강건 훈련 대비 메모리 사용량을 최대 50배까지 줄여, ImageNet-200에서의 대규모 모델 훈련을 가능하게 하였다.
  • 고정된 $\alpha=0.5$ 대비 적응형 $\alpha$를 사용한 동적 가중치 조정은 검증 가능 강건 정확도를 6.7% 향상시켜 30.9%에서 37.6%로, 테스트 정확도는 1.3% 향상시켜 71.4%에서 71.7%로 개선했다.
  • 제안된 간격 기울기 공격은 최신 기술 수준의 적대적 강건 네트워크에 대한 공격 성공률을 최대 40%까지 높여, 이들의 근본적인 취약성을 드러냈다.
  • 기존 최신 기술 수준의 검증 가능 강건 훈련 방법보다 MixTrain는 테스트 정확도를 13.2% 높여, 향상된 훈련 동역학이 정확도와 강건성 양측을 향상시킬 수 있음을 입증했다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.