Skip to main content
QUICK REVIEW

[論文レビュー] CoMoGAN: continuous model-guided image-to-image translation

Fabio Pizzati, Pietro Cerri|arXiv (Cornell University)|Mar 11, 2021
Generative Adversarial Networks and Image Synthesis参考文献 68被引用数 4
ひとこと要約

CoMoGANは、機能的インスタンス正規化(FIN)層と分離残差ブロック(DRB)を用いてコンテンツと多様体上の位置を分離することで、連続的で非線形なドメイン変換を学習する、新たな教師なし画像間変換フレームワークを導入する。物理的モデルに類似した単純なモデルをガイドとして用いながら、私的ターゲット特徴の発見を可能にし、サイクル的および線形な変換タスクにおいて、最先端のFIDおよびLPIPSスコアを達成し、先行手法を上回る性能を発揮する。

ABSTRACT

CoMoGAN is a continuous GAN relying on the unsupervised reorganization of the target data on a functional manifold. To that matter, we introduce a new Functional Instance Normalization layer and residual mechanism, which together disentangle image content from position on target manifold. We rely on naive physics-inspired models to guide the training while allowing private model/translations features. CoMoGAN can be used with any GAN backbone and allows new types of image translation, such as cyclic image translation like timelapse generation, or detached linear translation. On all datasets, it outperforms the literature. Our code is available at http://github.com/cv-rits/CoMoGAN .

研究の動機と目的

  • 中間ドメインの監視なしに教師なし連続的画像間変換を可能にすること。
  • タイムラプスや天候変化などの連続的変換を制御できるように、画像コンテンツと関数的多様体上の位置(ϕ)を分離すること。
  • ラベル付きの中間点がなくても、ターゲット多様体構造を発見できるモデルに依存しないフレームワークを構築すること。
  • モデルのガイドラインから模倣するのではなく、それから逸脱することによって一般化性と多様性を向上させること。

提案手法

  • 潜在コードの関数的マッピングを学習することで、ターゲットデータ多様体の連続的形状変更を可能にする機能的インスタンス正規化(FIN)層を導入する。
  • 新しい正規化および残差機構を通じてコンテンツと多様体上の位置(ϕ)を分離する分離残差ブロック(DRB)を採用する。
  • 生成出力とモデル予測出力の間の距離を推定することで、多様体の一貫性を強制するペアワイズϕ回帰ネットワーク(ϕ-Net)を用いる。
  • 2つの主要な損失を最適化する:物理的モデルに一致させるためのモデル再構成(ℒM)と、多様体上での構造的関係を保持するための多様体一貫性(ℒϕ)。
  • 任意のGANバックボーンを用いたエンドツーエンド学習を可能にし、単一およびマルチモーダルな変換設定をサポートする。
  • ϕ-Netを用いて入力からϕを推定することで、ϕに依存しない推論を実現し、固定されたソース条件がなくても絶対的および相対的変換(例:「いつでも → 昼」や「+5°」)が可能になる。

実験結果

リサーチクエスチョン

  • RQ1中間ドメインの監視やラベル付きの中間点がなくても、連続的で非線形な画像変換を学習できるか?
  • RQ2タイムラプスや天候変化などの連続的変換を制御できるように、画像コンテンツと多様体上の位置(ϕ)をどのように分離できるか?
  • RQ3単純な物理的モデルが、模倣を強制せずに複雑な私的ターゲット特徴の学習をガイドできるか?
  • RQ4GANが混合されたソースおよびターゲットデータから、無監視で関数的多様体を発見・再編成できる程度はどの程度か?
  • RQ5ソースドメインとターゲットドメインが事前に分割されていない真の無監視設定に、このフレームワークは一般化できるか?

主な発見

  • CoMoGANは、サイクル的(例:タイムラプス)および線形的(例:被写界深度、霧)画像変換タスクにおいて、両方で最先端の性能を達成し、先行する最先端手法を上回る。
  • Day→Timelapseタスクにおいて、ℒMおよびℒϕの両方の損失を用いたCoMoGANはLPIPSが0.236を達成し、アブレーション(ℒMなしで0.020、ℒϕなしで0.044)を著しく上回る。
  • モデル誘導型のアプローチと分離により、CoMoGANはターゲット固有の特徴を学習でき、模倣モデルとは異なりFIDが1.41に低下し、多様性が向上する。模倣モデルはモデル重みを増加させるとFIDが発散する。
  • 曇りや夜のデータが欠落していると、学習が著しく失敗する。これは、特に複雑な多様体構造において、データのスパarsityに極めて敏感であることを示している。
  • ϕに依存しない推論により、夜間画像などの困難な入力に対しても、絶対的および相対的変換(例:「いつでも → 昼」や「+5°」)が可能であり、耐障害性と一般化性を示している。
  • フレームワークは真の無監視設定(例:ドメインの混同があるMNIST-M)においても連続的多様体を正しく学習し、固定されたソース/ターゲット分割なしに有効な変換を生成した。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。