[論文レビュー] Training Compact CNNs for Image Classification using Dynamic-coded Filter Fusion
本稿では、事前学習モデルやスパース正則化に依存せずにコンパクトなCNNを訓練する、新しいフィルタープルーニング手法であるDynamic-coded Filter Fusion (DCFF) を提案する。温度制御された相互類似度分布をフィルタの代理指標として用いることで、DCFFは動的にフィルタの重要度を評価し、重み付き平均によるフィルタの統合を実行する。これにより、スクラッチからの効率的でエンドツーエンドの訓練が可能となる。本手法は、FLOPsとパラメータ数を顕著に削減しながら最先端の精度を達成しており、例としてCIFAR-10で93.47%のトップ-1精度を達成するコンパクトなVGGNet-16では72.77M FLOPs、1.06Mパラメータを実現している。
The mainstream approach for filter pruning is usually either to force a hard-coded importance estimation upon a computation-heavy pretrained model to select "important" filters, or to impose a hyperparameter-sensitive sparse constraint on the loss objective to regularize the network training. In this paper, we present a novel filter pruning method, dubbed dynamic-coded filter fusion (DCFF), to derive compact CNNs in a computation-economical and regularization-free manner for efficient image classification. Each filter in our DCFF is firstly given an inter-similarity distribution with a temperature parameter as a filter proxy, on top of which, a fresh Kullback-Leibler divergence based dynamic-coded criterion is proposed to evaluate the filter importance. In contrast to simply keeping high-score filters in other methods, we propose the concept of filter fusion, i.e., the weighted averages using the assigned proxies, as our preserved filters. We obtain a one-hot inter-similarity distribution as the temperature parameter approaches infinity. Thus, the relative importance of each filter can vary along with the training of the compact CNN, leading to dynamically changeable fused filters without both the dependency on the pretrained model and the introduction of sparse constraints. Extensive experiments on classification benchmarks demonstrate the superiority of our DCFF over the compared counterparts. For example, our DCFF derives a compact VGGNet-16 with only 72.77M FLOPs and 1.06M parameters while reaching top-1 accuracy of 93.47% on CIFAR-10. A compact ResNet-50 is obtained with 63.8% FLOPs and 58.6% parameter reductions, retaining 75.60% top-1 accuracy on ILSVRC-2012. Our code, narrower models and training logs are available at https://github.com/lmbxmu/DCFF.
研究の動機と目的
- 過剰な事前学習やハイパーパrameterに敏感なスパarsity制約に依存する既存のフィルタープルーニング手法の限界を解消すること。
- 微調整やスパース正則化を必要とせず、計算効率的かつ高精度なコンパクトなCNNを導出する手法を開発すること。
- 温度制御された相互類似度代理指標を用いて、訓練中に動的にフィルタの重要度を評価すること。
- フィルタの削除ではなく、相対的な重要度に基づく重み付き平均によるフィルタ統合を実施し、モデル容量を保持すること。
- スクラッチから訓練可能なコンパクトモデルが、優れた性能と低複雑性を達成できることを実証すること。
提案手法
- 各フィルタに、その代表性を表す温度制御された相互類似度分布を代理指標として割り当てる。
- Kullback-Leiblerダイバージェンスに基づく動的コード化基準を用い、各フィルタの代理指標を全フィルタの平均代理指標と比較することで、フィルタの重要度を評価する。
- 重要度スコアが低いフィルタは破棄されるのではなく、割り当てられた代理指標を重みとして用いた重み付き平均による統合が行われる。
- 統合されたフィルタは最終的なコンパクトモデルとして保持され、同時に訓練中にバックプロパゲーションにより元のフィルタが更新される。
- 温度パrameter Tを徐々に増加させることで、無限大に近づけることで、代理指標分布が1-ホットベクトルに収束し、動的な重要度再評価が可能になる。
- 本手法はスクラッチからのエンドツーエンド動作を実現し、事前学習への依存を排除するとともに、スパース正則化制約を回避する。
実験結果
リサーチクエスチョン
- RQ1計算コストの高い事前学習モデルに依存せずにフィルタープルーニングを実行できるか?
- RQ2ハイパーパrameterに敏感なスパarsity制約を導入せずに、動的なフィルタ重要度評価を達成できるか?
- RQ3代理指標に基づく重み付き平均によるフィルタ統合は、単純なフィルタ削除に比べ、モデル精度の維持に優れているか?
- RQ4正則化フリーでエンドツーエンドのアプローチにより、スクラッチからコンパクトなCNNを訓練し、最先端の性能を達成できるか?
- RQ5代理指標分布における温度パrameterが、最終的なコンパクトモデルの安定性と性能に与える影響は何か?
主な発見
- DCFFは、CIFAR-10で93.47%のトップ-1精度を達成するコンパクトなVGGNet-16において、わずか72.77M FLOPsおよび1.06Mパラメータを実現した。
- ResNet-50では、FLOPsを63.8%、パラメータ数を58.6%削減しながら、ImageNetで75.60%のトップ-1精度を維持した。
- 温度パrameter Tを10^4に増加させると、性能が安定化し、安定な重要度コード化に必要な1-ホット分布に近づくことが確認された。
- 層ごとのプルーニング比を構造探索(ABCPruner)やグローバルランク(EagleEye)で決定することで、手動の比率設定を上回る性能が得られ、DCFFは2256M FLOPsおよび18.02Mパラメータで75.79%のトップ-1精度を達成した。
- ランダムなフィルタ統合では性能が55.63%に低下し、代理指標に基づく重要度のヒューリスティックなガイドが不可欠であることが確認された。
- 本手法は、事前学習やスパarsity制約に依存しないコンパクトなCNN訓練において、既存のベースラインを上回る精度と効率性を示し、優位性を実証した。
より良い研究を、今すぐ始めましょう
論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。
クレジットカード登録不要
このレビューはAIが作成し、人間の編集者が確認しました。