Skip to main content
QUICK REVIEW

[논문 리뷰] AlphaNet: Improved Training of Supernets with Alpha-Divergence

Dilin Wang, Chengyue Gong|arXiv (Cornell University)|2021. 02. 16.
Advanced Neural Network Applications참고 문헌 50인용 수 4
한 줄 요약

이 논문은 적응형 α-분산을 사용하여 슈퍼넷을 훈련하기 위한 새로운 지식 정련 방법인 AlphaNet을 제안한다. 이는 교사 모델의 불확실성에 대한 과도 및 과소 추정을 동시에 줄이는 데 목적이 있다. 표준 KL 분산 대신 α-분산을 사용하고 기울기 클리핑을 통해 훈련을 안정화함으로써, AlphaNet은 단지 444M FLOPs에서 ImageNet의 상위 1위 정확도 80.0%를 달성하여 다양한 FLOP 제약 조건에서 이전 방법들을 능가한다.

ABSTRACT

Weight-sharing neural architecture search (NAS) is an effective technique for automating efficient neural architecture design. Weight-sharing NAS builds a supernet that assembles all the architectures as its sub-networks and jointly trains the supernet with the sub-networks. The success of weight-sharing NAS heavily relies on distilling the knowledge of the supernet to the sub-networks. However, we find that the widely used distillation divergence, i.e., KL divergence, may lead to student sub-networks that over-estimate or under-estimate the uncertainty of the teacher supernet, leading to inferior performance of the sub-networks. In this work, we propose to improve the supernet training with a more generalized alpha-divergence. By adaptively selecting the alpha-divergence, we simultaneously prevent the over-estimation or under-estimation of the uncertainty of the teacher model. We apply the proposed alpha-divergence based supernets training to both slimmable neural networks and weight-sharing NAS, and demonstrate significant improvements. Specifically, our discovered model family, AlphaNet, outperforms prior-art models on a wide range of FLOPs regimes, including BigNAS, Once-for-All networks, and AttentiveNAS. We achieve ImageNet top-1 accuracy of 80.0% with only 444M FLOPs. Our code and pretrained models are available at https://github.com/facebookresearch/AlphaNet.

연구 동기 및 목표

  • 지식 정련 과정에서 슈퍼넷 훈련 중 교사 모델의 불확실성에 대한 잘못된 추정 문제를 해결하기 위해, 표준 KL 분산이 학생 모델의 과도 또는 과소 추정을 유도하는 것을 방지한다.
  • 더 광범위한 분산 측도를 사용하여 가중치 공유 신경망 아키텍처 탐색(NAS)에서 하위 네트워크의 성능을 향상시키기 위해 노력한다.
  • 고기울기 분산에 기반한 정련의 안정적인 훈련 절차를 개발하여 높은 기울기 분산을 방지한다.
  • 슬림 가능 네트워크 및 가중치 공유 NAS를 포함한 다양한 슈퍼넷 아키텍처에서 적응형 α-분산의 유효성을 입증한다.
  • 제안된 AlphaNet 프레임워크를 사용하여 ImageNet에서 정확도-FLOP 무게 조정 기준으로 새로운 SOTA 성능을 확립한다.

제안 방법

  • 지식 정련에서 표준 KL 분산을 α-분산으로 대체한다. α-분산은 과도 및 과소 추정에 대한 제어를 유연하게 가능하게 하는 일반화된 분산 측도이다.
  • 교사 모델의 예측 불확실성에 대한 과도 및 과소 추정을 모두 방지하기 위해 동적으로 α 값을 선택하는 적응형 α-분산 메커니즘을 도입한다.
  • α-분산 손실에 대해 기울기 클리핑을 적용하여 훈련을 안정화시켜, 높은 기울기 분산에도 불구하고 최적화가 유효하게 유지되도록 한다.
  • 공동 훈련 중 모든 더 작은 하위 네트워크(학생)가 교사 모델로부터 소프트 레이블을 제공받기 위해 슈퍼넷의 가장 큰 하위 네트워크를 교사 모델로 사용한다.
  • 실제 레이블에 대한 교차 엔트로피 손실과 교사 모델의 소프트 레이블에 대한 α-분산 손실을 조합한 목적 함수로 슈퍼넷을 훈련한다.
  • 슬림 가능 네트워크와 가중치 공유 NAS 모두에 이 방법을 적용하여 다양한 FLOP 제약 조건에서 효율적인 아키텍처 탐색을 가능하게 한다.

실험 결과

연구 질문

  • RQ1KL 분산 대비 α-분산이 슈퍼넷에서 교사 모델의 불확실성에 대한 과도 및 과소 추정을 줄여 지식 정련 성능을 향상시킬 수 있는가?
  • RQ2적응형 α-분산은 다양한 FLOP 제약 조건에서 가중치 공유 NAS의 하위 네트워크 성능에 어떤 영향을 미치는가?
  • RQ3기울기 클리핑은 고기울기 분산이 최적화 목표로서의 타당성을 유지하면서도 훈련을 안정화시키는가?
  • RQ4제안된 방법은 NAS를 초월하여 단일 모델 정련, 예를 들어 큰 MobileNet에서 더 작은 변형으로의 지식 정련에도 일반화 가능한가?
  • RQ5다양한 α 값이 하위 네트워크 정확도에 미치는 영향은 무엇이며, 고정된 α 설정 대비 적응형 선택 전략이 더 우수한 성능을 낼 수 있는가?

주요 결과

  • AlphaNet은 단지 444M FLOPs로 ImageNet에서 상위 1위 정확도 80.0%를 달성하여 200–800 MFLOPs 범위의 효율적 모델에서 새로운 SOTA를 수립한다.
  • BigNAS, Once-for-All 네트워크, AttentiveNAS를 포함한 이전 SOTA 모델들과 비교해 다양한 FLOP 제약 조건에서 모두 슈퍼어닝 성능을 뛰어넘는다.
  • 적응형 α-분산을 사용함으로써 AlphaNet은 교사 모델의 불확실성에 대한 과도 및 과소 추정을 동시에 방지함으로써 하위 네트워크 성능을 향상시킨다.
  • 고정된 α 값(예: α = -1 또는 α = 1)을 사용하더라도 KL 기반 KD보다 성능 향상을 달성하며, 특히 적응형 버전이 가장 뛰어난 성능을 보인다.
  • 이 방법은 NAS를 초월해 일반화 가능하다. 단일 모델 정련에서도 AlphaNet으로 훈련된 학생 모델은 MobileNetV3, ShuffleNet, 비전 트랜스포머를 포함한 다양한 아키텍처에서 기준 KD보다 더 높은 ImageNet 상위 1위 정확도를 달성한다.
  • 기울기 클리핑은 분산의 타당성을 훼손하지 않으면서도 훈련을 안정화시켜, 적응형 α-분산 목표 함수의 신뢰할 수 있는 최적화를 가능하게 한다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.