[論文レビュー] COP: Customized Deep Model Compression via Regularized Correlation-Based Filter-Level Pruning
COPは、層間のフィルターレベルでの相関関係を用いて冗長性を特定し、パラメータ数と計算コストの正則化を組み合わせることで、カスタマイズ可能で細分化されたモデル圧縮を実現する、新しいフィルターレベルのプルーニング手法を提案する。VGG、ResNet、MobileNetを含む複数のアーキテクチャで、最小限の精度損失で最先端の圧縮比とスループット向上を達成する。
Neural network compression empowers the effective yet unwieldy deep convolutional neural networks (CNN) to be deployed in resource-constrained scenarios. Most state-of-the-art approaches prune the model in filter-level according to the "importance" of filters. Despite their success, we notice they suffer from at least two of the following problems: 1) The redundancy among filters is not considered because the importance is evaluated independently. 2) Cross-layer filter comparison is unachievable since the importance is defined locally within each layer. Consequently, we must manually specify layer-wise pruning ratios. 3) They are prone to generate sub-optimal solutions because they neglect the inequality between reducing parameters and reducing computational cost. Reducing the same number of parameters in different positions in the network may reduce different computational cost. To address the above problems, we develop a novel algorithm named as COP (correlation-based pruning), which can detect the redundant filters efficiently. We enable the cross-layer filter comparison through global normalization. We add parameter-quantity and computational-cost regularization terms to the importance, which enables the users to customize the compression according to their preference (smaller or faster). Extensive experiments have shown COP outperforms the others significantly. The code is released at https://github.com/ZJULearning/COP.
研究の動機と目的
- 既存のフィルターレベルプルーニング手法が、層間のフィルターレベルの冗長性を十分に考慮していないという限界に対処すること。
- 重要度スコアを層全体で正規化することで、グローバルかつ層間をまたがるフィルターレベルの重要度比較を可能にすること。
- 二重正則化を用いて、ユーザーがモデルサイズまたは推論速度の好みに応じて圧縮をカスタマイズできること。
- パラメータ削減と計算コスト削減の両方に感受性を持つプルーニング戦略を開発し、非効率な解を避けること。
提案手法
- COPはピアソン相関を用いて、異なる層間のフィルターレベルの冗長性を測定し、類似したフィルターレベルの検出を可能にする。
- 異なる層間のフィルターレベル重要度をスケーリング可能にするために、max正規化を適用し、グローバルな比較と一貫したプルーニング比を実現する。
- 二重正則化項を導入:一つはパラメータ数、もう一つは計算コストを対象とし、ユーザーが定義した圧縮の好みに応じて制御可能にする。
- 重要度スコアを、フィルターマグニチュード、相関に基づく冗長性、正則化項の重み付き和として再定義する。
- 組み合わせた重要度スコアに基づき、Top-K選択戦略を用いて層ごとにプルーニングを実行する。
- 微調整中に繰り返し適用することで、プルーニング後のモデル精度を維持する。
実験結果
リサーチクエスチョン
- RQ1フィルターレベルのプルーニング手法は、深層畳み込みニューラルネットワークにおいて複数の層にまたがる冗長なフィルターレベルを効果的に検出し、削除できるか?
- RQ2フィルターレベルの重要度を層全体で正規化することで、一貫性がありグローバルなプルーニング意思決定が可能になるか?
- RQ3パラメータ数と計算コストの正則化項を併用することで、より効率的かつカスタマイズ可能なプルーニング戦略を導けるか?
- RQ4提案手法は、多様なアーキテクチャにおいて、圧縮比、スループット、精度保持の観点で、既存の最先端手法を上回るか?
主な発見
- CIFAR-100では、NS、SFP、PFGMを含むすべてのベースラインを上回り、最高の圧縮比とスループット向上を達成した。
- VGG16およびResNet32では、元のモデルと1%以内の精度を維持しながら、最大80%のパラメータを削減した。
- MobileNetでは、ネイティブのディープワイド分離畳み込み圧縮よりも優れた圧縮とスループット向上を達成し、精度の低下は最小限に抑えられた。
- アブレーションスタディの結果、ピアソン相関とmax正規化が、保存された特徴マップの類似度を低減させる観点で最良の冗長性検出を実現した。
- 正則化項は有効であった:γを大きくするとパラメータ削減が優先され、βを大きくすると計算コスト削減が優先されるという、意図した動作を示した。
- 可視化分析により、COPでプルーニングされたモデルは、SFPやNSよりも冗長な特徴マップが少ないことが確認され、優れた冗長性除去性能を示した。
より良い研究を、今すぐ始めましょう
論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。
クレジットカード登録不要
このレビューはAIが作成し、人間の編集者が確認しました。