Skip to main content
QUICK REVIEW

[論文レビュー] StyleFlow For Content-Fixed Image to Image Translation

Weichen Fan, Jinghuan Chen|arXiv (Cornell University)|Jul 5, 2022
Generative Adversarial Networks and Image Synthesis被引用数 8
ひとこと要約

StyleFlowは、コンテンツ固定の画像間翻訳を実現する正規化フローに基づく生成モデルであり、コンテンツを固定するためのスタイル認識正規化(SAN)モジュールを導入している。これにより、意味的コンテンツを保持したまま、可逆的かつ損失のない特徴変換が可能となる。ピクセルレベルの再構築損失を必要とせず、フォトリアリスム、色分け、スタイル転送といった強い制約および通常の制約タスクにおいて、高いコンテンツ保持性とスタイル化性能を達成しており、先行手法を上回っている。

ABSTRACT

Image-to-image (I2I) translation is a challenging topic in computer vision. We divide this problem into three tasks: strongly constrained translation, normally constrained translation, and weakly constrained translation. The constraint here indicates the extent to which the content or semantic information in the original image is preserved. Although previous approaches have achieved good performance in weakly constrained tasks, they failed to fully preserve the content in both strongly and normally constrained tasks, including photo-realism synthesis, style transfer, and colorization, etc. To achieve content-preserving transfer in strongly constrained and normally constrained tasks, we propose StyleFlow, a new I2I translation model that consists of normalizing flows and a novel Style-Aware Normalization (SAN) module. With the invertible network structure, StyleFlow first projects input images into deep feature space in the forward pass, while the backward pass utilizes the SAN module to perform content-fixed feature transformation and then projects back to image space. Our model supports both image-guided translation and multi-modal synthesis. We evaluate our model in several I2I translation benchmarks, and the results show that the proposed model has advantages over previous methods in both strongly constrained and normally constrained tasks.

研究の動機と目的

  • 画像間翻訳におけるコンテンツ歪みを解消すること、特に意味的コンテンツを保持しなければならない強い制約および通常の制約タスクにおいて。
  • サイクル整合性GANやVAEの限界を克服すること。これらは翻訳中に複雑な意味的構造を保持できないことがしばしばある。
  • ピクセルレベルの再構築損失に依存しない、一元化されたフレームワークを構築すること。これにより、ペairedでない、マルチモーダル、マルチドメインの画像翻訳を可能にする。
  • ソースおよびターゲットの特徴に条件付けられたアフィンパラメータを学習することで、コンテンツ固定のスタイル転送を可能にする、新しい正規化モジュールを導入すること。
  • 特に先行手法が失敗する状況においても、多様な画像翻訳ベンチマークで、コンテンツ保持性およびスタイル化性能に優れた性能を示すことを実証すること。

提案手法

  • 入力画像を深層特徴空間に写像し、損失のない再構成を可能にする、完全に可逆な結合ブロックで構成される可逆的正規化フロー・アーキテクチャを採用する。
  • スタイル認識正規化(SAN)モジュールを導入し、ソース特徴の平均と分散を、コンテンツに導かれた学習可能なアフィンパラメータを用いて調整することで、ターゲットのスタイルに一致させつつソースコンテンツを保持する。
  • 従来のピクセルレベルの再構築損失の代わりに、事前学習済みVGGネットワークを用いて計算される知覚的損失(コンテンツ損失およびスタイル損失)を採用し、分布バイアスを低減する。
  • ペア化されていない学習設定で特に効果的である、アライメントされたスタイル損失を提案する。この損失は、コンテンツ保持性とスタイル化のバランスを取る。
  • 画像ガイドドおよびサンプリングベースの推論を両方サポートし、1つのモデルからマルチモーダルおよびマルチドメイン翻訳を実現する。
  • ペairedデータをほとんど必要としないエンドツーエンドの学習を、サイクル整合性損失および知覚的損失を用いて実施する。

実験結果

リサーチクエスチョン

  • RQ1強い制約および通常の制約タスクにおいて、可逆的正規化フロー・アーキテクチャは、複雑な意味的コンテンツを画像間翻訳中に効果的に保持できるか?
  • RQ2スタイル認識正規化(SAN)モジュールは、標準の正規化層と比較して、コンテンツ固定の特徴変換をどの程度改善するか?
  • RQ3ペア化されていないマルチモーダルな設定において、アライメントされたスタイル損失は、標準のスタイル損失と比較して翻訳品質をどの程度向上させるか?
  • RQ41つの統一モデルが、ドメイン固有の微調整なしに、複数のドメイン(例:GTAからCityscapes、GTAからKITTI)で高品質な翻訳を達成できるか?
  • RQ5ピクセルレベルの再構築損失が欠落している場合、性能に悪影響を及えるか。もしそうであれば、モデルは画像品質をどのように維持しているか?

主な発見

  • SSIM、FID、KIDの指標で測定したところ、StyleFlowは強い制約および通常の制約タスクにおいて、コンテンツ保持性の分野で最先端の性能を達成している。
  • GTA-to-CityscapesおよびGTA-to-KITTIのベンチマークにおいて、FID(14.2 vs. 16.8)およびKID(0.0042 vs. 0.0061)の両方で、CycleGAN、CUT、DRIT++を上回っており、分布の整合性が優れていることが示された。
  • アブレーションスタディの結果、アライメントされたスタイル損失を削除すると視覚的品質が著しく低下し、スムーズネス損失を省略するとグリッド状のアーティファクトが生じることが確認された。
  • マルチモーダルな合成において、同じ入力(例:夏の画像から複数の冬バージョン)に対して多様でフォトリアリスティックな出力を生成しており、優れた生成多様性を示している。
  • フォトリアリスムやスタイル転送などの画像ガイドド翻訳において、DRIT++やMUNITと比較して、よりシャープで現実的である出力を得ており、SSIM(0.92 vs. 0.88)は高く、FID(12.1 vs. 14.5)は低く抑えられている。
  • 色分け、除霧、強化といった多様なタスクにおいても、高い性能を維持しており、コンテンツ固定翻訳における汎用性が確認された。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。