Skip to main content
QUICK REVIEW

[논문 리뷰] Go Wide, Then Narrow: Efficient Training of Deep Thin Networks

Denny Zhou, Mao Ye|arXiv (Cornell University)|2020. 07. 01.
Stochastic Gradient Optimization Techniques인용 수 5
한 줄 요약

이 논문은 이론적 보장을 갖춘 효율적인 깊이 있는 얇은 네트워크를 훈련하기 위해 세 단계 훈련 방법—확장, 소환, 미세조정—을 제안한다. 먼저 넓은 네트워크를 훈련한 후, 그 중간 활성화 값을 이용해 차원 유지 선형 투영을 통해 얕은 네트워크를 초기화하는 계층별 소환을 통해, 성능이 뛰어나다: ResNet50는 ResNet101을 능가하고, BERT_BASE는 BERT_LARGE와 유사한 성능을 낸다. 이는 대규모 사전 훈련이나 압축이 필요로 하지 않는다.

ABSTRACT

For deploying a deep learning model into production, it needs to be both accurate and compact to meet the latency and memory constraints. This usually results in a network that is deep (to ensure performance) and yet thin (to improve computational efficiency). In this paper, we propose an efficient method to train a deep thin network with a theoretic guarantee. Our method is motivated by model compression. It consists of three stages. First, we sufficiently widen the deep thin network and train it until convergence. Then, we use this well-trained deep wide network to warm up (or initialize) the original deep thin network. This is achieved by layerwise imitation, that is, forcing the thin network to mimic the intermediate outputs of the wide network from layer to layer. Finally, we further fine tune this already well-initialized deep thin network. The theoretical guarantee is established by using the neural mean field analysis. It demonstrates the advantage of our layerwise imitation approach over backpropagation. We also conduct large-scale empirical experiments to validate the proposed method. By training with our method, ResNet50 can outperform ResNet101, and BERT Base can be comparable with BERT Large, when ResNet101 and BERT Large are trained under the standard training procedures as in the literature.

연구 동기 및 목표

  • 자원 제한된 장치에 배포하기 적합한 효율적인 컴팩트하고 깊이 있는 얇은 신경망을 훈련하는 데 도전하는 것.
  • 비볼록성과 소실되는 기울기로 인해 최적화가 어려운 깊이 있는 얇은 네트워크를 처음부터 훈련하는 데 어려움을 극복하는 것.
  • 큰 모델을 먼저 훈련하고 압축하는 비효율성을 피하면서도, 모델 압축의 이론적 근거가 있는 대안을 제공하는 것.
  • 평균 장 이론을 사용하여 깊이 있는 얇은 네트워크의 훈련 과정이 더 효율적임을 증명하는 것.

제안 방법

  • 이 방법은 먼저 목표로 하는 깊이 있는 얇은 네트워크를 깊이 있는 넓은 네트워크로 확장하고, 이를 수렴할 때까지 훈련한다.
  • 두 번째 단계에서는 넓은 네트워크의 중간 레이어 출력을 모방함으로써, 차원 유지 선형 변환을 사용하는 계층별 소환을 통해 얕은 네트워크를 초기화한다.
  • 선형 변환에는 넓은 네트워크의 출력 차원과 일치시키기 위한 확장 레이어와 원래 얕은 네트워크 차원으로 복원하기 위한 감소 레이어가 포함된다.
  • 소환 이후, 얕은 네트워크의 선형 레이어는 병합되어 원래 아키텍처로 복원되지만, 향상된 초기화 상태를 유지한다.
  • 마지막 단계는 잘 초기화된 얕은 네트워크를 표준적인 미세조정을 통해 최적 성능에 도달시키는 것이다.
  • 이론적 분석은 평균 장 이론을 사용하여, 제안된 방법 하에서 훈련 오차 경계가 깊이에 따라 선형적으로 증가하는 것을 보여주며, 이는 표준적인 처음부터 훈련할 경우의 지수적 증가와는 대조된다.

실험 결과

연구 질문

  • RQ1넓은 버전을 먼저 훈련하고, 이를 얕은 네트워크의 초기화에 사용함으로써 깊이 있는 얇은 네트워크를 더 효율적으로 훈련시킬 수 있는가?
  • RQ2차원 유지 투영을 사용하는 계층별 소환은 랜덤 또는 히우리스틱 초기화보다 최적화와 일반화 성능을 향상시키는가?
  • RQ3제안된 방법은 대규모 사전 훈련이나 압축 없이도 더 큰 모델과 유사한 성능을 달성할 수 있는가?
  • RQ4표준적인 처음부터 훈련할 경우 깊이 있는 얇은 네트워크에서 관찰되는 지수적 오차 증가를 피하는 데 이론적 근거가 있는가?

주요 결과

  • 제안된 방법으로 훈련한 ResNet50는 ImageNet에서 표준 백프로파게이션으로 훈련한 ResNet101보다 뛰어난 성능을 보였다.
  • 제안된 방법으로 훈련한 BERT_BASE는 일반적으로 훨씬 더 많은 파라미터와 계산 자원을 사용해 훈련되는 BERT_LARGE와 유사한 성능을 달성했다.
  • 평균 장 분석을 통해, 제안된 방법은 훈련 오차 경계를 깊이에 따라 지수적 증가에서 선형 증가로 줄였다.
  • 계층별 소환과 차원 유지 선형 투영을 통해, 레이어 차원이 다를 경우에도 넓은 네트워크에서 얇은 네트워크로 효과적인 지식 전이가 가능했다.
  • 실증 결과는 이미지 분류 및 자연어 처리 작업을 포함한 다양한 벤치마크에서 일관된 성능 향상을 보였다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.