Skip to main content
QUICK REVIEW

[論文レビュー] Ensemble-Compression: A New Method for Parallel Training of Deep Neural Networks

Shizhao Sun, Wei Chen|arXiv (Cornell University)|Jun 2, 2016
Advanced Neural Network Applications参考文献 26被引用数 5
ひとこと要約

本稿では、パラメータ平均化の代わりに出力アンサンブル平均化を採用することで、グローバルモデルの性能がローカルモデルの平均以上であることを保証する、深層ニューラルネットワークのための新規な並列学習フレームワークEC-DNNを提案する。アンサンブルベースの集約と知識蒸留によるモデル圧縮を組み合わせることで、MA-DNNよりも高い精度とより速い収束を達成し、ImageNetでは最大2.24倍の高速化と、CIFAR-10/100では一貫した性能向上を実現した。

ABSTRACT

Parallelization framework has become a necessity to speed up the training of deep neural networks (DNN) recently. Such framework typically employs the Model Average approach, denoted as MA-DNN, in which parallel workers conduct respective training based on their own local data while the parameters of local models are periodically communicated and averaged to obtain a global model which serves as the new start of local models. However, since DNN is a highly non-convex model, averaging parameters cannot ensure that such global model can perform better than those local models. To tackle this problem, we introduce a new parallel training framework called Ensemble-Compression, denoted as EC-DNN. In this framework, we propose to aggregate the local models by ensemble, i.e., averaging the outputs of local models instead of the parameters. As most of prevalent loss functions are convex to the output of DNN, the performance of ensemble-based global model is guaranteed to be at least as good as the average performance of local models. However, a big challenge lies in the explosion of model size since each round of ensemble can give rise to multiple times size increment. Thus, we carry out model compression after each ensemble, specialized by a distillation based method in this paper, to reduce the size of the global model to be the same as the local ones. Our experimental results demonstrate the prominent advantage of EC-DNN over MA-DNN in terms of both accuracy and speedup.

研究の動機と目的

  • 深層ニューラルネットワークの非凸性に起因する、並列学習におけるモデル平均化の不安定性を解消すること。
  • グローバルモデルの性能がローカルモデルの平均によって下限づけられることを保証する学習フレームワークの開発。
  • アンサンブル集約に起因するモデルサイズの爆発的増大を、各アンサンブルステップ後に効率的な圧縮で制御すること。
  • 追加の学習時間を最小限に抑えるために、圧縮をローカル学習に統合するための組み合わせ損失の導入。
  • MA-DNN や E-DNN といった既存手法と比較して、EC-DNN が精度、収束速度、通信効率の面で優れていることを実証すること。

提案手法

  • EC-DNNは、パラメータの平均化ではなく、各ローカルモデルの出力を平均化することでローカルモデルを集約し、重みが等しいローカルネットワークのアンサンブルとしてグローバルモデルを構築する。
  • グローバルモデルは、K個のローカルモデルの出力を入力とする追加の層を持つより大きなネットワークであり、各ブランチの重みは1/Kである。
  • 各アンサンブルステップの後、知識蒸留を用いてモデル圧縮を実施し、圧縮されたモデルがアンサンブルの予測を模倣するように学習させる。
  • 真のラベルからの損失とグローバルモデルからの仮ラベルからの損失を組み合わせた新しい組み合わせ損失を導入し、追加時間なしにローカル学習中に圧縮を可能にする。
  • EC-DNNでは、アンサンブル手法により同期ステップ間のトレーニングインターバルを長くできるため、MA-DNN よりも通信頻度を低くできる。
  • 本フレームワークは、異なるワーカー数と通信頻度を想定したCIFAR-10、CIFAR-100、ImageNetで評価された。

実験結果

リサーチクエスチョン

  • RQ1出力アンサンブル集約は、グローバルモデルの精度と収束安定性において、パラメータ平均化を上回ることができるか?
  • RQ2アンサンブルベースのグローバルモデルは、ローカルモデルの平均を上回る性能を保証するか?
  • RQ3アンサンブル集約に起因するモデルサイズの爆発的増大を、性能を損なわずに効果的に制御できるか?
  • RQ4追加計算コストを最小限に抑えて、ローカル学習に圧縮を統合できるか?
  • RQ5EC-DNNは、特に帯域制限下でもMA-DNN や E-DNN と比較して、より優れたスループットと頑健性を達成できるか?

主な発見

  • CIFAR-10では、EC-DNNはK=4のとき8.43%、K=8のとき8.19%のテスト誤差を達成し、それぞれMA-DNNの10.3%と9.99%を顕著に上回った。
  • CIFAR-100では、EC-DNNはK=4のとき30.26%、K=8のとき29.31%のテスト誤差を達成し、MA-DNNの36.18%と35.55%を上回った。
  • ImageNetでは、EC-DNN GがMA-DNN Gに対して最大2.24倍の高速化を達成し、初期学習段階でも優れた性能を示した。
  • CIFAR-10では、EC-DNN LがK=4のとき1.36倍、K=8のとき1.26倍の高速化を達成し、MA-DNN Lと比較してより高い精度を維持した。
  • EC-DNNの通信頻度τは、CIFAR-10で4k、CIFAR-100で2kであり、MA-DNNの16よりも顕著に高いことから、通信コストの低減が示された。
  • E-DNN(圧縮なし)はCIFAR-100でMA-DNNの性能に達しなかったが、EC-DNN Lは34.8%と35.1%の誤差を達成し、MA-DNN Lの36.39%と35.56%を上回った。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。