[論文レビュー] An Information Theory-inspired Strategy for Automatic Network Pruning
本稿では、反復的探索や再訓練を必要とせず、層出力に正規化ヒルバート・シュミット独立基準(nHSIC)を用いてチャネルの重要度を推定する、情報理論にインspiredされた自動ネットワークプリンティング手法であるITPrunerを提案する。アーキテクチャ探索を凸最適化問題に定式化し、1つのCPU/GPUで数秒で実行可能であり、最先端の圧縮トレードオフを達成する—例として、ResNet-50を用いたImageNetでは45.3%のFLOPs削減と75.75%のトップ1精度を達成している。
Despite superior performance on many computer vision tasks, deep convolution neural networks are well known to be compressed on devices that have resource constraints. Most existing network pruning methods require laborious human efforts and prohibitive computation resources, especially when the constraints are changed. This practically limits the application of model compression when the model needs to be deployed on a wide range of devices. Besides, existing methods are still challenged by the missing theoretical guidance. In this paper we propose an information theory-inspired strategy for automatic model compression. The principle behind our method is the information bottleneck theory, i.e., the hidden representation should compress information with each other. We thus introduce the normalized Hilbert-Schmidt Independence Criterion (nHSIC) on network activations as a stable and generalized indicator of layer importance. When a certain resource constraint is given, we integrate the HSIC indicator with the constraint to transform the architecture search problem into a linear programming problem with quadratic constraints. Such a problem is easily solved by a convex optimization method with a few seconds. We also provide a rigorous proof to reveal that optimizing the normalized HSIC simultaneously minimizes the mutual information between different layers. Without any search process, our method achieves better compression tradeoffs comparing to the state-of-the-art compression algorithms. For instance, with ResNet-50, we achieve a 45.3%-FLOPs reduction, with a 75.75 top-1 accuracy on ImageNet. Codes are avaliable at https://github.com/MAC-AutoML/ITPruner/tree/master.
研究の動機と目的
- 既存のネットワークプリンティング手法が、人的介入や反復的再訓練、高コストな探索プロセスを必要としているという限界を解消すること。
- 情報ボトルネック理論に基づいた理論的裏付けのある、自動的でないプリンティング戦略の開発。
- リソース制約が異なる多様なデバイスにおいても、効率的なモデル圧縮を可能にすること。
- ハイパーパramータチューニングやプリンティング後の精度回復ステップの必要性を排除すること。
提案手法
- 本手法は、特徴マップの独立性に基づいて、安定的で微分可能かつ一般化された層の重要度指標として、正規化ヒルバート・シュミット独立基準(nHSIC)を導入する。
- チャネル圧縮問題を二次制約を伴う線形計画問題として定式化し、アーキテクチャ探索を凸最適化問題に変換する。
- 凸ソルバを用いて効率的に最適化を実行し、1つのCPUまたはGPU上でサブ秒で推論が可能になる。
- 本手法は情報ボトルネック理論に基づいており、nHSICの最小化は層間の相互情報量の最小化に相当する。
- 本手法は2つのハイパーパramータを用いる:β(各層ごとの相対的圧縮率を制御)とn(nHSIC推定に必要な入力サンプル数)。
- 理論的証明により、nHSICの最小化が同時に層出力間の相互情報量の最小化に相当することが示されている。
実験結果
リサーチクエスチョン
- RQ1反復的探索や再訓練を必要とせず、理論的裏付けのある自動ネットワークプリンティング手法を、情報理論的原則から導出可能か?
- RQ2nHSICのような統計的依存度測定を用いて、層ごとの重要度を安定的かつ効率的に測定する方法は何か?
- RQ3アーキテクチャ探索問題を、高速かつスケーラブルなプリンティングを可能にする凸最適化問題に変換可能か?
- RQ4多様なモデルにおいて、精度とFLOPs削減の観点から、本手法は最先端手法と比較してどのように優れているか?
主な発見
- ITPrunerは、ResNet-50においてImageNetで45.3%のFLOPs削減を達成しつつ、トップ1精度が0.75%低下するにとどまり、最先端手法を上回っている。
- MobileNetV1では、FLOPsを削減する一方で、精度低下は0.8%にとどまり、AMCと比較して1.3%の精度低下にとどまる。これは、より優れた圧縮効率を示している。
- バッチサイズ8の条件下で、Google Pixel 2ではMobileNetV1で3倍、MobileNetV2で1.65倍の推論スピードアップを達成している。
- ITPrunerが得たアーキテクチャは、進化的アルゴリズムベースラインと非常に近く、トップ1精度の差はたった0.19%にとどまる。これは、検索プロセスなしで高い品質のアーキテクチャを達成できることを示している。
- 本手法はハイパーパramータの選択に対して頑健である:βとnの異なる値における精度のばらつきは0.1%未満であり、高い安定性と使いやすさを示している。
- 理論的分析により、nHSICの最小化が層出力間の相互情報量の最小化に等価であることが確認され、強い理論的裏付けが得られた。
より良い研究を、今すぐ始めましょう
論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。
クレジットカード登録不要
このレビューはAIが作成し、人間の編集者が確認しました。