Skip to main content
QUICK REVIEW

[논문 리뷰] LTD: Low Temperature Distillation for Gradient Masking-free Adversarial Training

Erh–Chung Chen, Che–Rung Lee|arXiv (Cornell University)|2021. 11. 03.
Adversarial Robustness in Machine Learning참고 문헌 55인용 수 11
한 줄 요약

이 논문은 기울기 마스킹을 피하기 위해 낮은 온도로 소프트 레이블을 사용하는 지식 distillation 기반 방법인 저온도 증류(Low Temperature Distillation, LTD)를 제안한다. 이 방법은 추가 데이터 없이 CIFAR-10에서 58.19%의 강건한 정확도와 ImageNet에서 42.08%의 강건한 정확도를 달성하며, 더 부드러운 클래스 간 확률 분포를 활용해 이전 방법들을 능가한다.

ABSTRACT

Adversarial training is a widely adopted strategy to bolster the robustness of neural network models against adversarial attacks. This paper revisits the fundamental assumptions underlying image classification and suggests that representing data as one-hot labels is a key factor that leads to vulnerabilities. However, in real-world datasets, data ambiguity often arises, with samples exhibiting characteristics of multiple classes, rendering one-hot label representations imprecise. To address this, we introduce a novel approach, Low-Temperature Distillation (LTD), designed to refine label representations. Unlike previous approaches, LTD incorporates a relatively low temperature in the teacher model, while maintaining a fixed temperature for the student model during both training and inference. This strategy not only refines assumptions about data distribution but also strengthens model robustness and avoids the gradient masking problem commonly encountered in defensive distillation. Experimental results demonstrate the efficacy of the proposed method when combined with existing frameworks, achieving robust accuracy rates of 58.19%, 31.13%, and 42.08% on the CIFAR-10, CIFAR-100, and ImageNet datasets, respectively, without the need for additional data.

연구 동기 및 목표

  • 딥 신경망에서 자연적 정확도와 강건한 정확도 사이의 격차를 해결하기 위해.
  • 특히 모호한 이미지에서 한정된 레이블 표현이 모델의 강건성에 악영향을 미치는 핵심 요인임을 규명하기 위해.
  • 기울기 마스킹 없이 클래스 간 관계를 포착하는 소프트 레이블 기반 학습 방법을 제안하기 위해.
  • 다른 온도로 설정된 교사 및 학생 모델을 사용한 수정된 증류 프레임워크를 통해 강건한 정확도를 향상시키기 위해.
  • 추가적인 비라벨 데이터에 의존하지 않고 CIFAR-10, CIFAR-100, ImageNet에서 최신 기준 강건한 정확도를 달성하기 위해.

제안 방법

  • LTD는 교사 모델이 낮은 온도로 훈련되어 소프트 레이블을 생성하는 지식 증류 프레임워크를 사용한다.
  • 학생 모델은 교사로부터 온도가 더 높은 다른 온도로 설정된 소프트 레이블을 사용하여 교차 엔트로피 손실로 훈련된다.
  • 기울기 마스킹을 피하기 위해 방어적 증류의 온도 기반 기울기 스무딩에 의존하지 않는다.
  • 소프트 레이블은 잘 훈련된 교사 모델에서 생성되며, 클래스 간 관계와 의미적 거리를 포착한다.
  • 강건한 정확도를 더욱 향상시키기 위해 AWP와 같은 적대적 훈련 기법과 통합된다.
  • 프레임워크는 CIFAR-10, CIFAR-100, ImageNet에서 Wide ResNet 및 ResNet-50 아키텍처를 대상으로 평가된다.

실험 결과

연구 질문

  • RQ1일반화된 레이블을 소프트 레이블로 대체하면 딥 신경망의 적대적 강건성 향상이 가능한가?
  • RQ2교사 모델에서 낮은 온도를 사용하면 강건한 일반화를 위한 소프트 레이블의 품질이 향상되는가?
  • RQ3교사 및 학생 모델에 서로 다른 온도를 적용하면 기울기 마스킹을 피하면서도 강건성을 향상시킬 수 있는가?
  • RQ4추가 데이터 없이 LTD는 기존의 적대적 훈련 방법과 비교해 강건한 정확도에서 어떤가?
  • RQ5LTD는 AWP와 같은 다른 강건한 훈련 기법과 효과적으로 조합되어 성능 향상을 이룰 수 있는가?

주요 결과

  • LTD는 추가 데이터 없이 WRN-34-10를 사용해 CIFAR-10에서 55.09%의 강건한 정확도를 달성하며, 기준 적대적 훈련을 능가한다.
  • AWP와 결합했을 때 LTD는 CIFAR-10에서 58.19%의 강건한 정확도를 달성하여, 추가 데이터 없이도 새로운 최고 기록을 수립한다.
  • CIFAR-100에서는 LTD가 31.13%의 강건한 정확도를 달성하여, 데이터 없이도 거의 최고 성능에 가까운 결과를 내놓는다.
  • ImageNet에서는 LTD를 적용한 모델이 동일한 아키텍처에서 LTD 없이 훈련한 모델 대비 약 4%의 강건한 정확도 향상을 기록한다.
  • 낮은 온도로 훈련된 교사 모델에서 유도된 소프트 레이블 사용은 오라클 분포와 모델 예측 간 격차를 크게 감소시킨다.
  • 적대적으로 훈련된 모델은 자연 정확도가 낮아서 나쁜 교사가 되므로, 소프트 레이블 생성에는 자연 훈련된 모델이 선호된다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.