Skip to main content
QUICK REVIEW

[論文レビュー] Training convolutional neural networks with cheap convolutions and online distillation

Jiao Xie, Shaohui Lin|arXiv (Cornell University)|Sep 28, 2019
Advanced Neural Network Applications被引用数 7
ひとこと要約

本論文は、アーキテクチャの再設計を伴わずに、深さ方向、グループ、シフト畳み込みなどの低コスト畳み込みを用いて畳み込みニューラルネットワーク(CNN)を圧縮する、新しいオンライン蒸留(OD)手法を提案する。低コスト畳み込みを用いて訓練する学生ネットワークと、オンライン特徴マップの連結と相互学習により動的に生成される強力な教師ネットワークを組み合わせることで、最小限の精度低下で最先端の圧縮性能を達成し、ImageNet上で最大5.66倍のFLOPs削減を実現しながらも高い精度を維持する。

ABSTRACT

The large memory and computation consumption in convolutional neural networks (CNNs) has been one of the main barriers for deploying them on resource-limited systems. To this end, most cheap convolutions (e.g., group convolution, depth-wise convolution, and shift convolution) have recently been used for memory and computation reduction but with the specific architecture designing. Furthermore, it results in a low discriminability of the compressed networks by directly replacing the standard convolution with these cheap ones. In this paper, we propose to use knowledge distillation to improve the performance of the compact student networks with cheap convolutions. In our case, the teacher is a network with the standard convolution, while the student is a simple transformation of the teacher architecture without complicated redesigning. In particular, we propose a novel online distillation method, which online constructs the teacher network without pre-training and conducts mutual learning between the teacher and student network, to improve the performance of the student model. Extensive experiments demonstrate that the proposed approach achieves superior performance to simultaneously reduce memory and computation overhead of cutting-edge CNNs on different datasets, including CIFAR-10/100 and ImageNet ILSVRC 2012, compared to the state-of-the-art CNN compression and acceleration methods. The codes are publicly available at https://github.com/EthanZhangYC/OD-cheap-convolution.

研究の動機と目的

  • リソース制限のあるデバイスにおける大規模CNNの高いメモリと計算コストを低減すること。
  • 特に、スクラッチから訓練される場合に低識別性を示しやすい、低コスト畳み込みを用いたコンパクトな学生ネットワークの性能を向上させること。
  • 事前学習済み教師や段階的訓練を不要にするために、学生と動的に生成される教師ネットワーク間でオンライン相互学習を可能にすることで、知識蒸留のニーズを排除すること。
  • 標準畳み込みを低コストな畳み込みに置き換えるプラグアンドプレイな手法を用いて、オンライン蒸留により効果的なCNNの圧縮と高速化を実現すること。

提案手法

  • 既存のアーキテクチャ(例:ResNet、DenseNet)の標準畳み込みを、深さ方向、グループ、シフト畳み込みなどの低コスト畳み込みに置き換えることで学生ネットワークを構築する。
  • 訓練中に、複数の学生ネットワークの特徴マップを連結し、新たな分類器を追加することで、オンライン教師を構築する。
  • 学生ネットワークとオンライン教師間で相互学習を実施し、エンドツーエンドの訓練中に共有知識を通じて両者が向上する。
  • 教師をリアルタイムに生成することで事前学習を回避し、段階的微調整なしにエンドツーエンド最適化を可能にする。
  • ResNet-18、ResNet-50、MobileNet V2など、さまざまなアーキテクチャへのプラグアンドプレイなデプロイメントをサポートする。
  • CIFAR-10/100およびImageNet ILSVRC 2012で評価され、データセットやモデルの種類に関わらず一貫した性能向上が確認された。

実験結果

リサーチクエスチョン

  • RQ1標準CNNアーキテクチャにアーキテクチャの再設計を伴わずに低コスト畳み込みを効果的に適用することで、メモリと計算量を削減できるか?
  • RQ2スクラッチから訓練される低コスト畳み込みを用いたコンパクトな学生ネットワークに対して、知識蒸留が精度を顕著に向上させられるか?
  • RQ3オンライン蒸留により、事前学習済み教師や段階的訓練の必要性を排除しつつ、性能を維持または向上させられるか?
  • RQ4提案手法のオンライン蒸留は、精度、FLOPs、パラメータ数の観点から、最先端のCNN圧縮技術と比較してどのように差をつけるか?

主な発見

  • CIFAR-10では、提案手法のOD-Depthwiseは、ResNet-56と比較してFLOPsを98.4%削減し、パラメータ数を90.5%削減しながらも、トップ1誤差6.46%を維持した。
  • ImageNetでは、OD-DepthwiseはResNet-50でトップ1誤差26.37%、トップ5誤差7.34%を達成し、SSS-26(28.18%/9.21%)およびGAL-0.5(28.05%/9.06%)を上回り、1.79倍の圧縮率を達成した。
  • OD-ShiftはResNet-18で1.06B FLOPsのSFPと比較して0.32B FLOPsにまで低下させ、5.66倍の高速化を達成したが、顕著な精度低下を示した。この問題は、深さ方向またはグループ畳み込みに切り替えることで是正された。
  • OD-Group-2は、ResNet-18で1.12B FLOPs、トップ5誤差11.33%を達成し、PFGMの11.53%誤差(1.06B FLOPs)と同等の性能を示し、効率と精度のトレードオフが優れていた。
  • 相互学習により、MobileNet V2の精度が向上し、オンライン蒸留が学生および教師両方の性能を向上させることを確認した。
  • オンライン蒸留フレームワークは、評価されたすべてのデータセットおよびモデルで最先端の性能を達成し、さまざまな低コスト畳み込みタイプに対して一貫した向上効果を示した。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。