[論文レビュー] Teachers Do More Than Teach: Compressing Image-to-Image Models
本稿では、画像対画像 GAN の圧縮のために、1つの教師モデルを用いてアーキテクチャ探索と知識蒸留を統合的に実行する CAT(Compression And Teaching)という手法を提案する。インセプションベースのリーマンブロックと1ステップのプルーニング戦略を導入することで、圧縮モデルが元の FID や mIoU スコアを同等または上回りながら、MACs を桁違いに削減するという、最先端のパフォーマンスと効率のトレードオフを達成した。
Generative Adversarial Networks (GANs) have achieved huge success in generating high-fidelity images, however, they suffer from low efficiency due to tremendous computational cost and bulky memory usage. Recent efforts on compression GANs show noticeable progress in obtaining smaller generators by sacrificing image quality or involving a time-consuming searching process. In this work, we aim to address these issues by introducing a teacher network that provides a search space in which efficient network architectures can be found, in addition to performing knowledge distillation. First, we revisit the search space of generative models, introducing an inception-based residual block into generators. Second, to achieve target computation cost, we propose a one-step pruning algorithm that searches a student architecture from the teacher model and substantially reduces searching cost. It requires no l1 sparsity regularization and its associated hyper-parameters, simplifying the training procedure. Finally, we propose to distill knowledge through maximizing feature similarity between teacher and student via an index named Global Kernel Alignment (GKA). Our compressed networks achieve similar or even better image fidelity (FID, mIoU) than the original models with much-reduced computational cost, e.g., MACs. Code will be released at https://github.com/snap-research/CAT.
研究の動機と目的
- リソース制約のあるデバイスにおいても高い計算コストとメモリ使用量を示す画像対画像 GAN の課題に対処すること。
- 既存の GAN 圧縮手法が画像品質を低下させたり、高価な探索プロセスを必要とすることの制限を克服すること。
- 教師ネットワークを用いてアーキテクチャ探索と知識蒸留の両方を実行することで、効率的で高忠実度のモデル圧縮を実現すること。
- 別個のスープネットを必要とせず、ハイパーパramータに依存する正則化を避けることで、アーキテクチャ探索の計算コストを低減すること。
- キーナルアライメントを用いて教師と学生の特徴表現を直接アライメントすることで、蒸留品質を向上させること。
提案手法
- 教師ジェネレータのコアとなる構築ブロックとして、効率的な学生アーキテクチャのための広い探索空間を可能にするインセプションベースのリーマンブロック(IncResBlock)を導入する。
- 訓練済みの教師ネットワークから直接チャネルを削除することで、ターゲットの MACs バジェットを満たす 1ステップのプルーニングアルゴリズムを提案する。これにより、反復的またはスパarsityに基づく探索の必要がなくなる。
- 追加の可学習層を必要とせず、教師と学生の特徴の類似度を最大化するキーナルアライメント(KA)に基づく知識蒸留技術を設計する。
- 同じ教師モデルを探索空間と知識蒸留のソースとして使用することで、別個のスープネットの必要性を排除し、トレーニングの複雑さを低減する。
- プルーニングに1つのハイパーパramータ(プルーニング比)を用いることで、トレーニングパイプラインを単純化し、チューニングのオーバーヘッドを削減する。
- KAに基づく蒸留を用いて学生ネットワークをエンドツーエンドでトレーニングし、学生が教師から高レベルの意味的表現を学習できるようにする。
![Figure 1 : Performance comparison between our and existing GAN compression techniques [ 11 , 20 , 36 , 64 , 70 ] on CycleGAN [ 85 ] for Horse $\shortrightarrow$ Zebra dataset. Smaller MACs indicates more efficient models. Lower FID indicates models can generate more realistic images. Our method (red](https://ar5iv.labs.arxiv.org/html/2103.03467/assets/x1.png)
実験結果
リサーチクエスチョン
- RQ11つの教師モデルが、画像対画像 GAN の圧縮において、探索空間と知識蒸留の両方のソースとして効果的に機能できるか?
- RQ2反復的トレーニングや ℓ¹ 正則化を必要とせずに、1ステップのプルーニングが効率的なアーキテクチャ探索を可能にするか?
- RQ3キーナルアライメントによる特徴空間の類似度が、追加のプロジェクション層に依存する従来の蒸留手法を上回るか?
- RQ4提案手法が、既存の GAN 圧縮技術と比較して、より優れたパフォーマンスと効率のトレードオフを達成できるか?
- RQ5圧縮モデルが計算コストを削減しながらも、元のモデルを上回る画像忠実度を達成できるか?
主な発見
- 提案された CAT 法は、先行研究と比較して、アーキテクチャ探索コストを最低でも 10,000 倍低減し、単一の GPU で 5 秒未塔の探索時間で実現した。
- Horse→Zebra CycleGAN ベンチマークでは、圧縮モデルが元のモデル(19.1)より低い FID(18.4)を達成し、MACs を 3.5 倍も削減した。
- Map→Aerial photo タスクにおける Pix2pix では、圧縮モデルが元のモデルよりも川や建物の画像がよりシャープに生成され、MACs を 4.2 倍も削減した。
- GauGAN では、圧縮モデルが元のモデル(13.8)より FID を 12.6 まで改善したが、MACs は 3.8 倍も削減した。
- すべてのベンチマークで、計算コストを著しく削減しながらも、FID や mIoU において元のモデルと同等または上回る性能を一貫して達成した。
- 可視化結果から、圧縮モデルは特に元のモデルが失敗するような挑戦的な入力において、より現実的で詳細な画像を生成することがわかった。

より良い研究を、今すぐ始めましょう
論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。
クレジットカード登録不要
このレビューはAIが作成し、人間の編集者が確認しました。