Skip to main content
QUICK REVIEW

[논문 리뷰] Ensemble-Compression: A New Method for Parallel Training of Deep Neural Networks

Shizhao Sun, Wei Chen|arXiv (Cornell University)|2016. 06. 02.
Advanced Neural Network Applications참고 문헌 26인용 수 5
한 줄 요약

이 논문은 딥 뉴럴 네트워크를 위한 새로운 병렬 학습 프레임워크인 EC-DNN을 제안한다. 이 프레임워크는 매개변수 평균화 대신 출력 앙상블 평균화를 도입하여 전역 모델 성능가 local 모델들의 평균 수준 이상을 보장한다. 앙상블 기반 집합과 지식 증류를 결합한 모델 압축 기법을 통해 EC-DNN는 MA-DNN보다 더 높은 정확도와 더 빠른 수렴 속도를 달성했으며, ImageNet에서는 최대 2.24배의 속도 향상을 보였고, CIFAR-10/100에서도 일관된 성능 향상을 보였다.

ABSTRACT

Parallelization framework has become a necessity to speed up the training of deep neural networks (DNN) recently. Such framework typically employs the Model Average approach, denoted as MA-DNN, in which parallel workers conduct respective training based on their own local data while the parameters of local models are periodically communicated and averaged to obtain a global model which serves as the new start of local models. However, since DNN is a highly non-convex model, averaging parameters cannot ensure that such global model can perform better than those local models. To tackle this problem, we introduce a new parallel training framework called Ensemble-Compression, denoted as EC-DNN. In this framework, we propose to aggregate the local models by ensemble, i.e., averaging the outputs of local models instead of the parameters. As most of prevalent loss functions are convex to the output of DNN, the performance of ensemble-based global model is guaranteed to be at least as good as the average performance of local models. However, a big challenge lies in the explosion of model size since each round of ensemble can give rise to multiple times size increment. Thus, we carry out model compression after each ensemble, specialized by a distillation based method in this paper, to reduce the size of the global model to be the same as the local ones. Our experimental results demonstrate the prominent advantage of EC-DNN over MA-DNN in terms of both accuracy and speedup.

연구 동기 및 목표

  • 딥 뉴럴 네트워크의 비볼록성으로 인해 모델 평균화가 불안정해질 수 있는 병렬 DNN 학습에서의 문제를 해결하기 위해.
  • 전역 모델 성능가 local 모델들의 평균 수준 이상으로 보장하는 학습 프레임워크를 개발하기 위해.
  • 앙상블 집합으로 인한 모델 크기 폭발 문제를 매번 앙상블 단계 이후 효율적인 압축을 통해 통제하기 위해.
  • 추가 학습 시간을 최소화하기 위해 압축을 로컬 학습에 통합하기 위해.
  • 기존 방법들인 MA-DNN 및 E-DNN과 비교해 EC-DNN이 정확도, 수렴 속도, 통신 효율성 면에서 뛰어나다는 것을 입증하기 위해.

제안 방법

  • EC-DNN는 매개변수 대신 로컬 모델들의 출력을 평균화하여 전역 모델을 집합화한다. 이로써 전역 모델은 동일한 가중치를 가진 K개의 로컬 네트워크로 구성된 앙상블이 된다.
  • 전역 모델은 K개의 로컬 모델 출력을 입력으로 받는 추가 레이어를 가진 더 큰 네트워크이며, 각 브랜치는 1/K의 가중치를 가진다.
  • 매번 앙상블 후 지식 증류를 이용한 모델 압축을 적용한다. 이때 압축된 모델은 앙상블의 예측을 모방하도록 훈련된다.
  • 기존 레이블의 손실과 전역 모델의 의사 레이블의 손실을 융합한 새로운 조합 손실 함수를 도입하여, 추가 시간 없이도 로컬 학습 중 압축을 통합한다.
  • EC-DNN는 동기화 단계 간의 훈련 간격을 늘릴 수 있기 때문에, MA-DNN보다 통신 빈도가 낮아진다.
  • 이 프레임워크는 다양한 워커 수와 통신 빈도를 가진 CIFAR-10, CIFAR-100, ImageNet에서 평가되었다.

실험 결과

연구 질문

  • RQ1출력 앙상블 집합이 매개변수 평균화보다 전역 모델 정확도와 수렴 안정성 면에서 뛰어나다고 할 수 있는가?
  • RQ2앙상블 기반 전역 모델이 로컬 모델들의 평균 성능 이상을 보장하는가?
  • RQ3앙상블 집합으로 인한 크기 폭발 문제를 성능 손실 없이 효과적으로 압축 기법으로 통제할 수 있는가?
  • RQ4압축을 추가적인 계산 부담 없이 로컬 학습에 통합할 수 있는가?
  • RQ5특히 제한된 대역폭 조건에서 EC-DNN이 MA-DNN 및 E-DNN보다 더 높은 속도 향상과 강건성을 확보하는가?

주요 결과

  • CIFAR-10에서 EC-DNN는 K=4일 때 8.43%, K=8일 때 8.19%의 테스트 오차를 기록했으며, 이는 MA-DNN의 10.3% 및 9.99%보다 뚜렷이 뛰어나다.
  • CIFAR-100에서 EC-DNN는 K=4일 때 30.26%, K=8일 때 29.31%의 테스트 오차를 기록했고, MA-DNN의 36.18% 및 35.55%보다 유의미하게 우수하다.
  • ImageNet에서 EC-DNN G는 MA-DNN G 대비 최대 2.24배의 속도 향상을 보였으며, 초기 학습 단계에서도 뛰어난 성능을 유지했다.
  • CIFAR-10에서 EC-DNN L은 K=4일 때 1.36배, K=8일 때 1.26배의 속도 향상을 보였고, 더 높은 정확도를 유지했다.
  • EC-DNN의 통신 빈도 τ는 CIFAR-10에서 4k, CIFAR-100에서 2k였으며, MA-DNN의 16보다 훨씬 높아져 통신 비용이 감소했다.
  • 압축 기능이 없는 E-DNN는 CIFAR-100에서 MA-DNN의 성능을 따라오지 못했지만, EC-DNN L은 34.8% 및 35.1%의 오차를 기록해 MA-DNN L의 36.39% 및 35.56%를 초월했다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.