[논문 리뷰] Revisiting Adversarial Robustness Distillation: Robust Soft Labels Make Student Better
이 논문은 강건한 소프트 레이블(RSLs)을 활용하여 적대적 방어력을 향상시키는 지식 정련 방법인 강건한 소프트 레이블 적대적 정련(RSLAD)을 제안한다. 대규모 적대적 훈련을 거친 교사 모델로부터 생성된 RSLs를 사용함으로써, 소형 학생 모델의 적대적 방어력을 향상시킨다. RSLAD는 모든 손실 항목에서 RSLs를 사용함으로써 기존 방법을 초월하여 AutoAttack에 대해 CIFAR-10 및 CIFAR-100에서 최신 기술 수준의 방어 성능을 달성한다. 특히, WideResNet-34-10 교사 모델에서 훈련된 ResNet-18 학생 모델이 교사 모델 자체를 능가하는 성능을 기록한다.
Adversarial training is one effective approach for training robust deep neural networks against adversarial attacks. While being able to bring reliable robustness, adversarial training (AT) methods in general favor high capacity models, i.e., the larger the model the better the robustness. This tends to limit their effectiveness on small models, which are more preferable in scenarios where storage or computing resources are very limited (e.g., mobile devices). In this paper, we leverage the concept of knowledge distillation to improve the robustness of small models by distilling from adversarially trained large models. We first revisit several state-of-the-art AT methods from a distillation perspective and identify one common technique that can lead to improved robustness: the use of robust soft labels -- predictions of a robust model. Following this observation, we propose a novel adversarial robustness distillation method called Robust Soft Label Adversarial Distillation (RSLAD) to train robust small student models. RSLAD fully exploits the robust soft labels produced by a robust (adversarially-trained) large teacher model to guide the student's learning on both natural and adversarial examples in all loss terms. We empirically demonstrate the effectiveness of our RSLAD approach over existing adversarial training and distillation methods in improving the robustness of small models against state-of-the-art attacks including the AutoAttack. We also provide a set of understandings on our RSLAD and the importance of robust soft labels for adversarial robustness distillation.
연구 동기 및 목표
- 모바일 기기와 같은 자원 제약 환경에서 소형 경량 딥 네트워크의 적대적 방어력을 향상시키기 위해.
- 소프트 레이블이 적대적 방어력 정련에 미치는 역할을 조사하며, 특히 강건한 소프트 레이블과 비강건한 소프트 레이블을 구분하는 데 중점을 둔다.
- 강건한 소프트 레이블을 최대한 활용하여 학생 모델 성능을 향상시키는 새로운 정련 프레임워크를 개발하기 위해.
- 교사 모델과 학생 모델의 복잡도 간 상호작용이 정련 효과에 미치는 영향을 이해하기 위해.
- 강건한 소프트 레이블이 효과적인 적대적 방어력 정련에 필수적임을 경험적으로 검증하기 위해.
제안 방법
- RSLAD는 학생 훈련 중 모든 손실 항목(교차 엔트로피 손실, 일致성 손실 등)에서 하드 레이블을 강건한 소프트 레이블(RSLs)로 대체한다.
- RSLs는 대규모 적대적 훈련을 거친 교사 모델(예: TRADES 또는 PGD 기반 AT 사용)에 의해 생성되며, 이는 강건한 예측을 반영한다.
- 학생 모델은 자연 입력과 적대적 입력에 대해 RSLs를 지도로 사용하여 교사의 예측을 모방하도록 훈련된다.
- 이 방법은 청소된 데이터, 적대적 데이터, 일치성 신호 등 모든 훈련 신호에 대해 지식 정련을 적용하며, RSLs를 주요 지도로 사용한다.
- 프레임워크는 다양한 교사 아키텍처를 사용하여 ResNet-18 및 WideResNet 학생 모델을 대상으로 CIFAR-10 및 CIFAR-100에서 평가된다.
- 제거 분석에서는 RSLs를 자연 소프트 레이블(NSLs) 및 스무스 소프트 레이블(SSLs)과 비교하여, 소프트 레이블의 강건성이 핵심적임을 입증한다.

실험 결과
연구 질문
- RQ1적대적으로 훈련된 교사 모델로부터 유도된 강건한 소프트 레이블을 사용하면 소형 학생 모델의 적대적 방어력이 크게 향상되는가?
- RQ2소프트 레이블 유형의 선택(RSL 대비 NSL 또는 SSL)이 정련된 학생 모델의 방어력에 어떤 영향을 미치는가?
- RQ3교사 모델의 복잡도가 정련된 학생 모델의 방어력에 미치는 영향은 어떠한가?
- RQ4중간 크기의 교사 모델에서 정련하면 더 큰 또는 동일한 크기의 교사 모델에서 정련하는 것보다 더 나은 방어력을 달성할 수 있는가?
- RQ5적대적 정련에서 강건한 포화 또는 강건한 과소적합 현상이 발생하는가? 이는 학생 성능에 어떤 영향을 미치는가?
주요 결과
- RSLAD는 CIFAR-10에서 최신 기술 수준의 방어 성능을 달성하였으며, WideResNet-34-10 교사 모델에서 훈련된 ResNet-18 학생 모델이 AutoAttack에 대해 51.49%의 정확도를 기록하였다.
- 비강건한 소프트 레이블(예: 자연 소프트 레이블(NSLs) 또는 스무스 소프트 레이블(SSLs))을 사용할 경우 방어력이 심각하게 저하되며, NSLs 사용 시 AA 정확도는 42.08%로 떨어졌다.
- 교사 모델의 복잡도가 증가함에 따라 학생의 방어력이 단순히 증가하지는 않으며, 오히려 '강건한 포화' 현상이 관찰되었다. 이는 중간 크기의 교사 모델(예: WideResNet-34-10)에서 성능이 최고조에 이르렀음을 의미한다.
- 놀랍게도, 더 넓고 복잡한 교사 모델에서 정련된 ResNet-18 학생 모델이 자신의 교사 모델을 초월하는 방어력을 기록하였다. 이는 적대적 훈련에서 강건한 과소적합 현상이 존재함을 시사한다.
- 교사 모델이 학생 모델보다 약 4.5배 더 크면 최적의 방어력 향상이 달성되며, 이는 교사-학생 모델의 능력 균형이 중요함을 확인한다.
- 경험적 결과는 강건한 소프트 레이블이 효과적인 정련을 위해 필수적임을 보여주며, 비강건한 레이블은 학생 모델을 오도할 수 있음을 입증한다. 강건한 레이블은 교사의 진정된 강건한 행동을 표현하지만, 비강건한 레이블은 잘못된 방향으로 유도할 수 있다.
![Figure 2: Attention and saliency maps on adversarial examples. Teacher: WideResNet-34-10 trained by TRADES; ARD: the ResNet-18 student trained using ARD with the Teacher network; RSLAD: the ResNet-18 student trained using our RSLAD with the Teacher network. Heatmaps are generated by Grad-Cam [ 38 ]](https://ar5iv.labs.arxiv.org/html/2108.07969/assets/x2.png)
더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.