[論文レビュー] GAN Slimming: All-in-One GAN Compression by A Unified Optimization Framework
本稿では、生成対抗ネットワーク(GAN)のエンドツーエンド圧縮のための最初の統合最適化フレームワーク、GANスリミング(GS)を提案する。このフレームワークは、最小最大化目的関数内に統合的にモデル distillation、チャネルプルーニング、量子化を最適化することで、一括して学習を行う。CartoonGANでは最大47倍の圧縮が達成され、品質劣化は最小限に抑えられ、個別に適用された圧縮技術を用いた最先端手法を上回る性能を示す。
Generative adversarial networks (GANs) have gained increasing popularity in various computer vision applications, and recently start to be deployed to resource-constrained mobile devices. Similar to other deep models, state-of-the-art GANs suffer from high parameter complexities. That has recently motivated the exploration of compressing GANs (usually generators). Compared to the vast literature and prevailing success in compressing deep classifiers, the study of GAN compression remains in its infancy, so far leveraging individual compression techniques instead of more sophisticated combinations. We observe that due to the notorious instability of training GANs, heuristically stacking different compression techniques will result in unsatisfactory results. To this end, we propose the first unified optimization framework combining multiple compression means for GAN compression, dubbed GAN Slimming (GS). GS seamlessly integrates three mainstream compression techniques: model distillation, channel pruning and quantization, together with the GAN minimax objective, into one unified optimization form, that can be efficiently optimized from end to end. Without bells and whistles, GS largely outperforms existing options in compressing image-to-image translation GANs. Specifically, we apply GS to compress CartoonGAN, a state-of-the-art style transfer network, by up to 47 times, with minimal visual quality degradation. Codes and pre-trained models can be found at https://github.com/TAMU-VITA/GAN-Slimming.
研究の動機と目的
- リソース制約のあるモバイルデバイスへのパラメータ量の多い GAN のデプロイを解決すること。
- 複数の圧縮技術を組み合わせた際の GAN の学習の不安定性、特に性能の崩壊を回避すること。
- GAN に対して、distillation、プルーニング、量子化といった複数の圧縮手法を統合的に最適化するフレームワークを構築すること。
- 個々の圧縮技術をヒューリスティックに積み重ねるのではなく、統合的最適化が GAN 圧縮において顕著に優れていることを実証すること。
- 効率的かつエンドツーエンドの圧縮により、高品質な GAN をモバイルデバイスに実用的にデプロイ可能にする。
提案手法
- モデル distillation、チャネルプルーニング、量子化を、GAN の最小最大化損失と同時に学習可能な統合的最適化目的関数に統合する。
- すべての圧縮技術を統合的に最適化できる、微分可能で一貫した目的関数を採用する。
- チャネルプルーニングに構造的スパarsity制約を適用し、重みのバイナリゼーション中に性能を維持するための量子化感知学習を統合する。
- 教師ネットワークの特徴マップと出力分布を模倣するように学生生成器を学習することで、知識 distillation を活用する。
- GAN の性能に不可欠な敵対的訓練ダイナミクスを保持するため、最小最大化訓練目的関数を採用する。
- 高レベルの意味的コンテンツを保持するため、distillation の過程で知覚的損失を監視信号として用いる。
実験結果
リサーチクエスチョン
- RQ1複数の圧縮技術を、学習の不安定化を引き起こさずに、1つのフレームワークに効果的に統合できるか?
- RQ2統合的最適化アプローチが、GAN において、逐次的またはヒューリスティックに積み重ねた圧縮手法よりも顕著に優れているか?
- RQ3最小最大化目的関数の統合が、圧縮された GAN の性能にどのように影響するか?
- RQ4distillation、プルーニング、量子化の統合的最適化によって、FLOPs とモデルサイズをどれほど削減できるか、同時に画像品質を保持できるか?
- RQ5本フレームワークは、サイクル整合性のない GAN、例えばエンコーダデコーダ型スタイル変換ネットワークに対しても汎用的か?
主な発見
- GANスリミングは、CartoonGANに対して最大47倍のFLOPs圧縮と235倍のモデルサイズ削減を達成し、視覚的品質の劣化は最小限に抑えられる。
- GS-8は、FLOPsを56.46 GFLOPsから1.20 GFLOPsへ47倍に圧縮し、モデルサイズも42.34 MBから0.18 MBへ235倍に削減し、高品質なコマックライゼーションを維持する。
- GS-32はFLOPsを42倍に圧縮(1.34 GFLOPs)し、モデルサイズは0.80 MBにまで削減され、GDにおける手作業で設計された学生ネットワークを著しく上回るFIDスコアと視覚的品質を達成する。
- distillationの後にプルーニング(D+CP)や後処理量子化(postQ)を単純に積み重ねる方法は、深刻な性能劣化を引き起こし、統合的最適化の必要性を裏付ける。
- distillationで知覚的損失の代わりにMSE損失を用いると、画像品質が著しく低下するため、高レベルの意味的監視の重要性が確認される。
- 最小最大化目的関数を圧縮フレームワークに統合することで、敵対的訓練を用いない手法(例:CEC)と比較して、顕著に優れた結果が得られる。
より良い研究を、今すぐ始めましょう
論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。
クレジットカード登録不要
このレビューはAIが作成し、人間の編集者が確認しました。