Skip to main content
QUICK REVIEW

[논문 리뷰] Circumventing Outliers of AutoAugment with Knowledge Distillation

Longhui Wei, An Xiao|arXiv (Cornell University)|2020. 03. 25.
Advanced Neural Network Applications참고 문헌 59인용 수 8
한 줄 요약

이 논문은 강력한 데이터 증강으로 인해 발생하는 훈련 불안정성 문제를 완화하기 위해 지식 정련을 AutoAugment와 통합하는 방법을 제안한다. 강력한 증강은 분류에 유용한 특징을 제거하고 레이블의 모호성을 유도할 수 있으나, 교사 모델이 부드러운 레이블을 제공함으로써 훈련을 안정화시키고, 추가 데이터 없이 ImageNet에서 85.8%의 새로운 SOTA(top-1) 정확도를 달성한다.

ABSTRACT

AutoAugment has been a powerful algorithm that improves the accuracy of many vision tasks, yet it is sensitive to the operator space as well as hyper-parameters, and an improper setting may degenerate network optimization. This paper delves deep into the working mechanism, and reveals that AutoAugment may remove part of discriminative information from the training image and so insisting on the ground-truth label is no longer the best option. To relieve the inaccuracy of supervision, we make use of knowledge distillation that refers to the output of a teacher model to guide network training. Experiments are performed in standard image classification benchmarks, and demonstrate the effectiveness of our approach in suppressing noise of data augmentation and stabilizing training. Upon the cooperation of knowledge distillation and AutoAugment, we claim the new state-of-the-art on ImageNet classification with a top-1 accuracy of 85.8%.

연구 동기 및 목표

  • 강력한 데이터 증강으로 인해 발생하는 AutoAugment의 훈련 불안정성과 성능 저하 문제를 해결하기 위해.
  • 증강에 의해 유도된 노이즈로 인해 진짜 레이블이 신뢰할 수 없어질 경우 지식 정련이 견고한 지도 신호로 기능할 수 있는지 조사하기 위해.
  • 특히 고용량 네트워크에서 극단적인 데이터 증강 정책 하에서 비전 모델의 일반화 및 강인성을 향상시키기 위해.
  • 추가적인 약한 레이블 또는 레이블이 없는 데이터를 사용하지 않고도 ImageNet에서 최고의 성능을 달성하기 위해.

제안 방법

  • 사전 훈련된 교사 모델을 사용하여 증강된 이미지의 부드러운 확률 분포를 생성하고, 이를 진짜 레이블과 함께 학생 네트워크를 안내하는 데 사용한다.
  • 지식 정련 손실은 교사 및 학생 모델의 상위-K 클래스 확률 간의 KL 발산을 통해 계산되며, 증강의 강도가 증가함에 따라 K도 증가한다.
  • 정제 손실은 하이퍼파rameter λ에 의해 가중되며, 강도가 높은 증강에서는 교사의 지시를 강조하기 위해 λ를 증가시킨다.
  • 학생 모델은 진짜 레이블에 대한 교차 엔트로피 손실과 교사가 제공한 부드러운 레이블에 대한 KL 발산 손실을 조합하여 훈련된다.
  • 이 방법은 AutoAugment 및 RandAugment의 검색 공간에 모두 적용되었으며, 다양한 모델 규모에서 일관된 성능 향상을 보였다.
  • EfficientNet-B8와 같이 큰 모델의 경우 GPU 메모리 제약을 고려해 최고 성능을 낸 EfficientNet-B7 모델을 교사로 사용하였다.

실험 결과

연구 질문

  • RQ1강력한 증강으로 인해 분류에 중요한 특징이 제거되면서 노이즈가 발생하는 AutoAugment 환경에서 지식 정련이 훈련을 효과적으로 안정화시킬 수 있는가?
  • RQ2교사 모델이 제공하는 부드러운 레이블을 사용함으로써 고강도 데이터 증강으로 인한 레이블 모호성의 부정적 영향을 줄일 수 있는가?
  • RQ3특히 EfficientNet-B7 및 B8와 같은 고용량 모델에서 정제를 적용했을 때 AutoAugment 기반 훈련의 성능은 어떻게 변화하는가?
  • RQ4제안된 방법이 약한 레이블 또는 레이블이 없는 이미지와 같은 추가 훈련 데이터에 의존하지 않고도 ImageNet에서 최고의 정확도를 달성할 수 있는가?
  • RQ5증강 강도와 정제를 위해 고려해야 할 상위-K 클래스 수 사이에 상관관계가 존재하는가?

주요 결과

  • 제안된 방법은 추가 훈련 데이터 없이 EfficientNet-B8를 사용하여 ImageNet에서 85.8%의 새로운 SOTA(top-1) 정확도를 달성하였으며, 이는 이전 최고 기록보다 0.3% 향상된 성과이다.
  • EfficientNet-B7에서는 top-1 정확도를 84.9%에서 85.5%로 향상시켜 0.6%의 유의미한 향상을 이루었으며, 적대적 예제 없이 AdvProp를 초월하는 성능을 보였다.
  • 강력한 증강 조건에서도 훈련이 안정화되었으며, 높은 왜곡 강도를 가진 기준 RandAugment는 종종 최적화가 불안정해지는 경향이 있었다.
  • 강력한 기준(예: PyramidNet + ShakeDrop)을 사용한 CIFAR-100에서는 테스트 오차 10.6%를 기록하여 유사한 훈련 비용을 가진 모든 유사 방법보다 뛰어난 성능을 보였다.
  • 교사 모델을 사용함으로써 데이터 증강에 의해 유도된 노이즈, 특히 밝기 변화, 이동, 기울임 변형 등으로 인해 의미 정보가 손실되는 경우에 특히 효과적으로 억제되었다.
  • 다양한 모델 규모와 증강 정책에 걸쳐 일관된 향상이 관찰되어, 본 방법의 일반화 가능성과 강인성을 확인할 수 있었다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.