[논문 리뷰] Towards Practical Lottery Ticket Hypothesis for Adversarial Training
이 논문은 적대적 훈련 중 표준 로또 티켓보다 훨씬 빠르게 수렴하는 프루닝된 하위신경망인 '부스팅 티켓'을 소개한다. 학습률, 프루닝 비율, 모델 용량 등의 철저한 하이퍼파라미터 튜닝을 통해 이러한 하위신경망을 식별함으로써, WideResNet-34-10을 사용할 때 CIFAR-10에서 적대적 훈련 시간을 최대 49% 감소시켰으며, 최신 기술 수준의 강건성을 확보하였다.
Recent research has proposed the lottery ticket hypothesis, suggesting that for a deep neural network, there exist trainable sub-networks performing equally or better than the original model with commensurate training steps. While this discovery is insightful, finding proper sub-networks requires iterative training and pruning. The high cost incurred limits the applications of the lottery ticket hypothesis. We show there exists a subset of the aforementioned sub-networks that converge significantly faster during the training process and thus can mitigate the cost issue. We conduct extensive experiments to show such sub-networks consistently exist across various model structures for a restrictive setting of hyperparameters ($e.g.$, carefully selected learning rate, pruning ratio, and model capacity). As a practical application of our findings, we demonstrate that such sub-networks can help in cutting down the total time of adversarial training, a standard approach to improve robustness, by up to 49\% on CIFAR-10 to achieve the state-of-the-art robustness.
연구 동기 및 목표
- 적대적 훈련 중 표준 로또 티켓보다 훨씬 빠르게 수렴하는 하위신경망을 식별하는 것.
- 프루닝된 하위신경망(부스팅 티켓)에서 더 빠른 수렴을 가능하게 하는 하이퍼파라미터를 조사하는 것.
- 약한 강건성을 지닌 모델을 프루닝하여 강력한 적대적 훈련을 가속화하는 데 사용할 수 있는 부스팅 티켓을 도출하는 것.
- 강건성을 훼손하지 않고 적대적 훈련의 총 훈련 비용을 줄이는 것.
제안 방법
- 수정된 로또 티켓 탐색 프로토콜을 사용하여 반복적 인과 기반 프루닝과 초기화로부터의 재훈련을 통해 부스팅 티켓을 식별한다.
- 학습률, 프루닝 비율, 모델 용량이 부스팅 티켓 성능에 미치는 영향을 체계적으로 평가한다.
- 약한 강건성을 지닌 모델에 FGSM 기반의 적대적 훈련을 적용하여 프루닝 마스크를 생성한 후, 프루닝된 하위신경망을 재훈련하여 강력한 강건성을 확보한다.
- 두 단계 과정을 사용한다: 먼저 약한 강건성을 지닌 모델을 훈련하고, 그 다음에 이를 프루닝하여 강력한 적대적 훈련에서 빠른 수렴을 이룰 수 있는 부스팅 티켓을 찾는다.
- WideResNet-34-10에서 표준 적대적 훈련과 부스팅 티켓 기반 접근법 간의 훈련 시간과 강건 정확도를 비교한다.
- VGG-16, ResNet-18, WideResNet 아키텍처 전반에서 광범위한 분석 실험을 수행하여 일반화 성능을 검증한다.
실험 결과
연구 질문
- RQ1적대적 훈련 중 표준 로또 티켓보다 훨씬 빠르게 수렴하는 하위신경망이 존재할 수 있는가?
- RQ2학습률, 프루닝 비율, 모델 용량 중 어떤 하이퍼파라미터가 부스팅 효과에 가장 강하게 영향을 미치는가?
- RQ3약한 강건성을 지닌 모델에서 도출된 부스팅 티켓이 강력한 강건성을 지닌 모델의 훈련을 가속화할 수 있는가?
- RQ4부스팅 티켓 현상은 적대적 훈련 환경에서도 지속되는가?
주요 결과
- CIFAR-10에서 WideResNet-34-10을 사용할 때 부스팅 티켓은 총 적대적 훈련 시간을 최대 49% 감소시키며 최신 기술 수준의 강건 정확도를 달성한다.
- WideResNet-34-10에서 파라미터의 80%를 프루닝한 경우, 부스팅 티켓은 단 한 번의 훈련 에포크 후에도 90.88%의 테스트 정확도를 달성하여 30개 이상의 에포크가 필요한 모델들과 동일한 성능을 보인다.
- 부스팅 효과는 학습률, 프루닝 비율, 네트워크 용량에 가장 민감하며, 최적의 설정이 빠른 수렴을 가능하게 한다.
- 부스팅 티켓은 적대적 훈련 체계 내에 존재하며, 약한 강건성을 지닌 모델을 프루닝함으로써 식별할 수 있으며, 이는 강력한 강건성을 지닌 모델의 빠른 훈련을 가능하게 한다.
- 표준 Madry et al. 적대적 훈련보다 더 높은 강건 정확도를 달성하면서도 총 훈련 시간을 49% 감소시킨다.
- 이동 공격 결과는 부스팅 티켓을 사용해 훈련한 모델과 Madry et al.의 방법을 사용한 모델 간에 공유되는 결정 경계가 존재함을 보여주며, 강건성의 일치를 시사한다.
더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.