Skip to main content
QUICK REVIEW

[論文レビュー] Fully Learnable Group Convolution for Acceleration of Deep Neural Networks

Xijun Wang, Meina Kan|arXiv (Cornell University)|Mar 31, 2019
Advanced Neural Network Applications参考文献 44被引用数 4
ひとこと要約

本稿では、エンド・ツー・エンド学習中に最適なチャネルおよびフィルターグルーピングを自動で学習できる、完全に学習可能なグループ畳み込み(FLGC)という新しいグループ畳み込みモジュールを提案する。この手法により、精度を損なわずに顕著な高速化が実現され、CPU上でのResNet50と比較して最大5倍の高速化を達成する。FLGCは動的なグループ構造の学習と任意のグループ数のサポートを可能にし、標準的および学習可能なグループ畳み込み手法を上回る精度と効率性を実現する。

ABSTRACT

Benefitted from its great success on many tasks, deep learning is increasingly used on low-computational-cost devices, e.g. smartphone, embedded devices, etc. To reduce the high computational and memory cost, in this work, we propose a fully learnable group convolution module (FLGC for short) which is quite efficient and can be embedded into any deep neural networks for acceleration. Specifically, our proposed method automatically learns the group structure in the training stage in a fully end-to-end manner, leading to a better structure than the existing pre-defined, two-steps, or iterative strategies. Moreover, our method can be further combined with depthwise separable convolution, resulting in 5 times acceleration than the vanilla Resnet50 on single CPU. An additional advantage is that in our FLGC the number of groups can be set as any value, but not necessarily 2^k as in most existing methods, meaning better tradeoff between accuracy and speed. As evaluated in our experiments, our method achieves better performance than existing learnable group convolution and standard group convolution when using the same number of groups.

研究の動機と目的

  • スマートフォンや組み込みシステムなどのリソース制約のあるデバイスにおけるディープニューラルネットワークの高い計算コストとメモリコストに対処すること。
  • 事前に定義された2段階または反復的戦略に依存する既存のグループ畳み込み手法の制限を克服すること。
  • あらゆるディープニューラルネットワークアーキテクチャにシームレスに統合可能な、柔軟でエンド・ツー・エンドで訓練可能なグループ畳み込みモジュールを開発すること。
  • 2の累乗に限定されない任意のグループ数を可能にし、モデルの精度と推論速度のトレードオフをより良いものにすること。
  • 動的なグループ構造学習を通じて、精度を維持または向上させながら顕著な推論高速化を達成すること。

提案手法

  • エンド・ツー・エンドのバックプロパゲーションにおいて、入力チャネルと畳み込みフィルタの両方のグルーピングを同時に学習する完全に学習可能なグループ畳み込み(FLGC)モジュールを提案する。
  • ネットワーク全体の損失に基づいて、入力チャネルおよびフィルタの最適な割り当てを自動で決定できる微分可能グルーピング機構を導入する。
  • 2^kに制限されない任意のグループ数をサポートし、モデルの精度と推論速度の間でより柔軟かつ効果的なトレードオフを実現できる。
  • FLGCを深度分離畳み込みと組み合わせることで、さらに推論を高速化し、単一CPU上でのバニラResNet50と比較して最大5倍の高速化を達成する。
  • 標準的な残差ブロックアーキテクチャを採用し、1×1畳み込みの部分をFLGCに置き換え、120エポックにわたりコサイン学習率スケジュールでモデルを訓練する。
  • 公平な比較のため、ベースラインモデル(例:CondenseNet)と同一のハイパーパrameterを採用し、性能向上がFLGCモジュール自体の効果によるものであることを保証する。

実験結果

リサーチクエスチョン

  • RQ1事前に定義された戦略や反復的戦略に依存せずに、エンド・ツー・エンドで最適なチャネルおよびフィルターグルーピングを自動で学習できるグループ畳み込みモジュールは構築可能か?
  • RQ22の累乗に限定されない任意のグループ数を許容することで、従来のグループ畳み込み手法と比較して、より優れた精度-速度トレードオフが達成できるか?
  • RQ3FLGCを深度分離畳み込みと効果的に組み合わせることで、精度の低下を伴わずCPU上でより大きな高速化を達成できるか?
  • RQ4最先端の学習可能なグループ畳み込み(例:CondenseNetにおけるLGC)および標準的グループ畳み込みと比較して、FLGCは精度および計算効率の点で優れているか?
  • RQ5FLGCは、ResNet や MobileNetV2 などのさまざまなネットワークアーキテクチャに柔軟に埋め込み可能であり、性能を維持しながら推論を高速化できるか?

主な発見

  • ImageNetでは、44M FLOPsでトップ1誤差6.77%を達成し、同じアーキテクチャおよびグループ数の下で、標準的グループ畳み込み(29.0%誤差)およびLGC(26.2%誤差)を上回る性能を示した。
  • CIFAR-10では、ResNet50-FLGC2が44M FLOPsで6.77%の誤差を達成し、ResNet56-pruned [25](90M FLOPsで6.94%誤差)およびResNet56-pruned [14](62M FLOPsで8.2%誤差)を上回った。
  • 8グループを用いたMobileNetV2-FLGCは、76M FLOPsでトップ1誤差6.91%を達成し、MobileNetV2-SGC(7.51%誤差)を上回り、NASNet-Aのようなより大きなモデルに近い性能を示した。
  • 深度分離畳み込みと組み合わせた場合、FLGCはバニラResNet50と比較して単一CPU上で最大5倍の推論高速化を実現した。
  • 任意のグループ数(例:G=2からG=8)をサポートし、グループ数の増加に伴って性能が安定または向上する傾向を示しており、堅牢性と柔軟性を実証した。
  • FLOP数が同程度または低い状態で、標準的グループ畳み込みおよびCondenseNetのLGCを上回る精度を達成したため、グループ構造のエンド・ツー・エンド学習におけるFLGCの優位性が証明された。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。