Skip to main content
QUICK REVIEW

[論文レビュー] Distilling portable Generative Adversarial Networks for Image Translation

Hanting Chen, Yunhe Wang|arXiv (Cornell University)|Mar 7, 2020
Generative Adversarial Networks and Image Synthesis参考文献 29被引用数 4
ひとこと要約

本稿では、画像対画像翻訳におけるモバイルデプロイ用に、重い生成対抗ネットワーク(GAN)を圧縮するための知識蒸留フレームワークを提案する。大規模な教師GANの出力および特徴量レベルの分布を軽量な学生生成器および識別器が模倣するように訓練することで、最大93%少ないパラメータ数と93%低いFLOPsを達成しながら、高い画像忠実度と知覚的品質を維持した、最先端の性能を実現した。

ABSTRACT

Despite Generative Adversarial Networks (GANs) have been widely used in various image-to-image translation tasks, they can be hardly applied on mobile devices due to their heavy computation and storage cost. Traditional network compression methods focus on visually recognition tasks, but never deal with generation tasks. Inspired by knowledge distillation, a student generator of fewer parameters is trained by inheriting the low-level and high-level information from the original heavy teacher generator. To promote the capability of student generator, we include a student discriminator to measure the distances between real images, and images generated by student and teacher generators. An adversarial learning process is therefore established to optimize student generator and student discriminator. Qualitative and quantitative analysis by conducting experiments on benchmark datasets demonstrate that the proposed method can learn portable generative models with strong performance.

研究の動機と目的

  • 高い計算コストとメモリ消費量のため、モバイルデバイスへの重いGANのデプロイに課題が生じるという問題に対処すること。
  • 分類モデルに主に用いられてきた知識蒸留を、生成モデル、特に画像対画像翻訳用のGANに拡張すること。
  • 教師GANから学生GANに知識を転送することで、生成器と識別器の両方を同時に圧縮すること。
  • 知覚的損失、L1損失、三重損失を組み合わせ、敵対的訓練を加えることで、軽量な学生モデルの性能を向上させること。
  • ペaired(pix2pix)およびunpaired(CycleGAN)の両方の画像翻訳タスクにわたる一般化を示すこと。

提案手法

  • 学生生成器は、教師生成器の出力画像および特徴表現を一致させるために、L1損失と知覚的損失を用いて訓練される。
  • 学生識別器が、実画像と教師および学生生成器からの生成画像を区別するように導入される。
  • 学生GANはミニマックス敵対的目的関数を最適化することで、教師GANからデータ分布を学習する。
  • 学生生成器の総損失には、L1損失、知覚的損失、および教師からの知識蒸留損失が含まれる。
  • 学生識別器の総損失には、実画像および教師・学生ネットワークからの生成画像に基づく敵対的損失が含まれる。
  • 本フレームワークは、ペアド(pix2pix)およびアンペアド(CycleGAN)の両方の画像翻訳タスクに適用され、一貫した性能向上が得られた。

実験結果

リサーチクエスチョン

  • RQ1知識蒸留が、分類モデルにとどまらず、画像対画像翻訳用のGANの圧縮に対しても効果的に適応可能であるか?
  • RQ2学生識別器を共同で訓練することで、圧縮された学生生成器の生成品質が向上するか?
  • RQ3大幅に少ないパラメータ数とFLOPsを有する学生GANが、画像翻訳タスクにおいて重い教師GANと同等の性能を達成できるか?
  • RQ4L1損失、知覚的損失、および三重損失といった異なる損失成分が、蒸留された学生モデルの性能にどのように寄与しているか?
  • RQ5提案手法が、ペアドおよびアンペアドの画像翻訳フレームワークといった、異なるGANアーキテクチャに一般化可能か?

主な発見

  • 提案手法により、学生生成器のパラメータ数が715.65Kにまで削減され、FLOPsは3.19Gにまで低下し、教師の11.38Mパラメータ数と47.19G FLOPsに対して、それぞれ93.7%および93.2%の削減が達成された。
  • 馬→シマウマおよび夏→冬の翻訳タスクにおいて、蒸留された学生GANは教師GANと同等の画像品質を達成し、初期学習やバニラ蒸留のモデルを上回った。
  • アブレーションスタディの結果、L1損失、知覚的損失、三重損失を敵対的訓練と組み合わせた場合が、FIDおよびLPIPSスコアで最高を記録し、各コンponentの有効性が裏付けられた。
  • アンペアドのCycleGAN設定において、教師の1/16のパラメータ数を有する学生モデルが同程度の性能を達成したため、強力な一般化性能が示された。
  • 学生識別器の導入により、ぼやけた画像の発生が抑制され、実写に近いリアルな画像が生成され、学生識別器なしのモデルと比較して忠実度が向上した。
  • Cityscapesデータセットでは、52.22のFIDスコアを達成し、ベースライン学生モデル(53.15)およびバニラ蒸留(52.50)を上回ったが、使用パラメータ数ははるかに少なかった。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。