Skip to main content
QUICK REVIEW

[論文レビュー] Learning Spatial Pyramid Attentive Pooling in Image Synthesis and Image-to-Image Translation

Wei Sun, Tianfu Wu|arXiv (Cornell University)|Jan 18, 2019
Generative Adversarial Networks and Image Synthesis参考文献 50被引用数 8
ひとこと要約

本稿では、アトリウス空間ピラミッドプーリング、キャスケードアテンション、リプルス接続を統合した軽量で汎用的なアーキテクチャモジュール、Spatial Pyramid Attentive Pooling (SPAP) を提案する。SPAP は、GAN や CycleGAN における特徴統合を向上させることで、学習可能なアテンションを用いたマルチスケールのコンテキストモデリングを可能にし、従来の手法と比較してパrameter数を少なくした状態で最先端または同等の性能を達成する。画像合成および画像対画像翻訳の品質が向上する。

ABSTRACT

Image synthesis and image-to-image translation are two important generative learning tasks. Remarkable progress has been made by learning Generative Adversarial Networks (GANs)~\cite{goodfellow2014generative} and cycle-consistent GANs (CycleGANs)~\cite{zhu2017unpaired} respectively. This paper presents a method of learning Spatial Pyramid Attentive Pooling (SPAP) which is a novel architectural unit and can be easily integrated into both generators and discriminators in GANs and CycleGANs. The proposed SPAP integrates Atrous spatial pyramid~\cite{chen2018deeplab}, a proposed cascade attention mechanism and residual connections~\cite{he2016deep}. It leverages the advantages of the three components to facilitate effective end-to-end generative learning: (i) the capability of fusing multi-scale information by ASPP; (ii) the capability of capturing relative importance between both spatial locations (especially multi-scale context) or feature channels by attention; (iii) the capability of preserving information and enhancing optimization feasibility by residual connections. Coarse-to-fine and fine-to-coarse SPAP are studied and intriguing attention maps are observed in both tasks. In experiments, the proposed SPAP is tested in GANs on the Celeba-HQ-128 dataset~\cite{karras2017progressive}, and tested in CycleGANs on the Image-to-Image translation datasets including the Cityscape dataset~\cite{cordts2016cityscapes}, Facade and Aerial Maps dataset~\cite{zhu2017unpaired}, both obtaining better performance.

研究の動機と目的

  • GAN や CycleGAN における生成学習を改善する汎用的で軽量なアーキテクチャモジュールの設計を目的とする。
  • 生成タスクにおけるアンビエント Atrous Spatial Pyramid Pooling (ASPP) の限界を克服し、より良いマルチスケール特徴集約を実現するための学習可能なアテンションを導入することを目的とする。
  • マルチリーチフィールドモデリング、アテンションベースの統合、リプルス学習を組み合わせることで、生成器および識別器における特徴表現を向上させることを目的とする。
  • モデルの複雑さを著しく増加させることなく、画像合成および画像対画像翻訳における画像品質と構造的忠実度を向上させることを目的とする。

提案手法

  • SPAP は、特徴マップからのマルチスケールコンテキストを捉えるために、拡張率を用いたアトリウス畳み込みを統合する。
  • キャスケードアテンション機構を導入し、ピラミッドレベル間を段階的に特徴を統合する。この統合は粗い順から細かい順、または逆順に可能である。
  • アテンション重みは、位置に依存する学習可能な全結合層を用いて計算され、空間的位置およびスケールごとの特徴の重要度を調整する。
  • リプルス接続は、元の入力とアテンション調整済み特徴の凸結合によって実装され、学習可能なゲートにより情報の保持と最適化の改善が図られる。
  • このモジュールはプラグアンドプレイであり、GAN や CycleGAN の生成器および識別器アーキテクチャの標準レイヤーに簡単に置き換え可能である。
  • 本手法は、Celeba-HQ-128 で使用される SNDCGAN を用いた非条件付き画像合成および、Cityscapes、Facade、Aerial Maps データセットで使用される CycleGAN を用いた非ペairド画像対画像翻訳の両方で評価されている。

実験結果

リサーチクエスチョン

  • RQ1統一されたアーキテクチャモジュールは、GAN や CycleGAN の生成器および識別器におけるマルチスケール特徴統合を改善できるか?
  • RQ2ピラミッドレベル間のキャスケードアテンション機構を導入することで、生成タスクにおけるアンビエント ASPP 統合を上回る性能が得られるか?
  • RQ3SPAP は、モデルの深さやパrameter数を増加させることなく、画像合成および画像対画像翻訳における画像品質と構造的忠実度を向上させられるか?
  • RQ4SPAP は、特に PatchGAN ベースのモデルにおける識別器の有効な受容 field にどのような影響を与えるか?
  • RQ5SPAP は、スタックド CycleGAN とプログレッシブトレーニングを用いるようなより複雑なモデル(例:SCAN)と同等の性能を達成できるか?

主な発見

  • SPAP は Celeba-HQ-128 においてアンビエント CycleGAN や SNDCGAN を上回り、より現実的で詳細な顔画像を生成し、FID スコアと IS スコアが向上した。
  • 画像対画像翻訳のタスクでは、Cityscapes、Facade、Aerial Maps データセットにおいて、SCAN と同等またはそれ以上の結果を達成し、PSNR および SSIM 値が向上した。
  • Map ⇔ Aerial データセットでは、SPAP を搭載したモデルが PSNR 27.8、SSIM 0.86 を達成し、CycleGAN を上回り、SCAN の性能に近づいた。
  • SPAP のアテンションマップから、粗いレベルの特徴はグローバルコンテキスト(例:背景、髪)に注目しているのに対し、細かいレベルの特徴はローカルディテール(例:目、眼鏡)に注目していることが明らかになり、スケールに応じた適切なアテンションが実現されている。
  • SNDCGAN では識別器の受容 field が 52 から 100 に拡大され、PatchGAN では 236×236 にまで拡大された。これは、深さやパrameter数を増加させることなく、構造的識別性能が向上したことを示している。
  • 大幅に小さいにもかかわらず、SPAP はスタックド CycleGAN とプログレッシブトレーニングを用いるより複雑な SCAN モデルと同等の性能を達成した。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。