Skip to main content
QUICK REVIEW

[論文レビュー] Dual Attention GANs for Semantic Image Synthesis

Hao Tang, Song Bai|arXiv (Cornell University)|Aug 29, 2020
Generative Adversarial Networks and Image Synthesis参考文献 48被引用数 4
ひとこと要約

本稿では、位置ごとの空間的アテンションモジュールとスケールごとのチャネルアテンションモジュールを統合することで、アーキテクチャの変更や追加学習を伴わずに空間的およびチャネル的次元における意味的整合性をモデル化する、新しい意味的画像合成フレームワークであるDual Attention GANs (DAGAN)を提案する。DAGANは、パrameter数を少なく抑えつつ、従来手法と比較してぼやけやアーティファクトを顕著に低減し、最先端の性能を達成する。

ABSTRACT

In this paper, we focus on the semantic image synthesis task that aims at transferring semantic label maps to photo-realistic images. Existing methods lack effective semantic constraints to preserve the semantic information and ignore the structural correlations in both spatial and channel dimensions, leading to unsatisfactory blurry and artifact-prone results. To address these limitations, we propose a novel Dual Attention GAN (DAGAN) to synthesize photo-realistic and semantically-consistent images with fine details from the input layouts without imposing extra training overhead or modifying the network architectures of existing methods. We also propose two novel modules, i.e., position-wise Spatial Attention Module (SAM) and scale-wise Channel Attention Module (CAM), to capture semantic structure attention in spatial and channel dimensions, respectively. Specifically, SAM selectively correlates the pixels at each position by a spatial attention map, leading to pixels with the same semantic label being related to each other regardless of their spatial distances. Meanwhile, CAM selectively emphasizes the scale-wise features at each channel by a channel attention map, which integrates associated features among all channel maps regardless of their scales. We finally sum the outputs of SAM and CAM to further improve feature representation. Extensive experiments on four challenging datasets show that DAGAN achieves remarkably better results than state-of-the-art methods, while using fewer model parameters. The source code and trained models are available at https://github.com/Ha0Tang/DAGAN.

研究の動機と目的

  • 既存のGANベースの手法が、弱い意味的制約と無視された構造的相関により、ぼやけた出力や一貫性の欠如を抱えるという限界に対処すること。
  • 特徴表現における空間的およびチャネルワイドなアテンションを明示的にモデル化することで、クラス内における意味的整合性を向上させること。
  • ネットワーク構造を変更せず、追加の学習コストをかけずに統合可能な軽量で汎用的なモジュールを設計すること。
  • 高解像度および細粒度のオブジェクト合成を含む多様なデータセットにおいて、優れた画像品質と意味的整合性を達成すること。

提案手法

  • 同じ意味的ラベルを持つピクセル間の相関を、空間的距離にかかわらず計算する位置ごとの空間的アテンションモジュール(SAM)を提案し、局所的およびグローバルな意味的整合性を向上させる。
  • 異なるスケールおよびチャネルにおける特徴マップを適応的に再キャリブレーションするスケールごとのチャネルアテンションモジュール(CAM)を導入し、関連する特徴を強調することで表現を向上させる。
  • SAMとCAMの出力を要素ごとの加算により統合し、特徴表現を豊かにし、意味的整合性を強化する。
  • 提案されたアテンションモジュールをバックボーンアーキテクチャを変更せずに生成器に組み込み、標準的なGANフレームワーク(生成器と判別器)を採用する。
  • グローバルなコンテキストに基づいてアテンション重みを計算する学習可能なアテンションメカニズムを採用し、モデルが意味的に関連する領域や特徴に注目できるようにする。
  • 敵対的損失と知覚的損失を用いて、エンド・トゥ・エンドでDAGANモデルを学習させ、現実的で意味的に正確な画像合成を保証する。

実験結果

リサーチクエスチョン

  • RQ1空間的およびチャネルワイドなアテンションを同時にモデル化することで、生成画像における意味的整合性が向上するか?
  • RQ2提案されたアテンション機構は、既存のGANベースの手法と比較してぼやけやアーティファクトを低減するか?
  • RQ3アテンションモジュールは、アーキテクチャの変更や追加の学習コストなしに、既存のGANアーキテクチャに適用可能か?
  • RQ4二重アテンション機構は、解像度やオブジェクトの複雑さが異なる多様なデータセットにおいてどの程度有効か?

主な発見

  • Cityscapesデータセットでは、mIoUが66.1を達成し、ベースライン(61.3)から4.8ポイント向上し、強い意味的整合性を示した。
  • CityscapesにおけるFIDスコアは60.3であり、ベースライン(71.8)から11.5ポイント低下し、画像の現実性と多様性が顕著に向上したことを示した。
  • 最先端のGauGANと比較して、DAGANはより正確で一貫性のある意味的マップを生成し、道路や車両などのオブジェクト領域で顕著な改善が見られた。
  • アブレーションスタディの結果、SAMとCAM-IIを併用した場合が最良のパフォーマンスを示し、個別のモジュールやCaiら(2019)の先行手法を大きく上回った。
  • 提案されたモジュールは軽量かつ汎用的であり、計算オーバーヘッドを最小限に抑えつつ、既存のGANフレームワークへの統合が可能である。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。