Skip to main content
QUICK REVIEW

[論文レビュー] Cross-Domain Cascaded Deep Feature Translation

Oren Katzir, Dani Lischinski|arXiv (Cornell University)|Jun 4, 2019
Generative Adversarial Networks and Image Synthesis参考文献 35被引用数 11
ひとこと要約

本稿では、事前学習されたVGG-19ネットワークの深層特徴を段階的・深層から浅層へと翻訳することで、顕著な幾何的形状変形を実現しながらも意味的整合性を保つ、クロスドメイン画像間翻訳手法を提案する。事前学習済みの意味的特徴と特徴マップ上の adversarial 学習を活用することで、zebra-to-giraffe や elephant-to-zebra といった困難な形状変形タスクにおいて、FID スコアで CycleGAN や MUNIT、DRIT を上回る最先端の性能を達成した。

ABSTRACT

In recent years we have witnessed tremendous progress in unpaired image-to-image translation methods, propelled by the emergence of DNNs and adversarial training strategies. However, most existing methods focus on transfer of style and appearance, rather than on shape translation. The latter task is challenging, due to its intricate non-local nature, which calls for additional supervision. We mitigate this by descending the deep layers of a pre-trained network, where the deep features contain more semantics, and applying the translation from and between these deep features. Specifically, we leverage VGG, which is a classification network, pre-trained with large-scale semantic supervision. Our translation is performed in a cascaded, deep-to-shallow, fashion, along the deep feature hierarchy: we first translate between the deepest layers that encode the higher-level semantic content of the image, proceeding to translate the shallower layers, conditioned on the deeper ones. We show that our method is able to translate between different domains, which exhibit significantly different shapes. We evaluate our method both qualitatively and quantitatively and compare it to state-of-the-art image-to-image translation methods. Our code and trained models will be made available.

研究の動機と目的

  • 形状と外観が著しく異なるドメイン間で、ペairされない画像間翻訳の課題に対処すること。
  • インスタンスレベルの監視や複雑なアーキテクチャの変更を必要とせずに、画像翻訳における顕著な幾何的変形を可能にすること。
  • 分類ネットワーク(VGG-19)から得た事前学習済みの深層特徴を活用し、より一貫性のある形状翻訳を実現すること。
  • 深層から浅層へと段階的に翻訳を行うパイプラインを構築し、深い層の出力を浅い層の翻訳に条件づけることで階層的フィードバックを実現すること。
  • オブジェクトのポーズ、インスタンス数、部分的オクルージョンを保持する意味的整合性のある翻訳を実現すること。

提案手法

  • 本手法は、ソースドメインおよびターゲットドメインの画像に対して、事前学習済みVGG-19ネットワークの複数の層で深層特徴マップを抽出する。
  • 深層特徴マップの対応層間で、段階的・粗いから細かい順に adversarial 翻訳を実行する。翻訳は最も意味的である最も深い層から開始する。
  • 各トランスレーターネットワークは、前の層の翻訳出力を条件として、現実的なターゲットドメイン特徴を生成するように adversarial に訓練される。
  • 最終的な画像は、DosovitskiyとBrox(2016)が提案したように、事前学習済みVGG-19を用いた特徴の逆変換によって再構築される。
  • 各層のトランスレーターを逐次的に訓練するマルチステージの訓練戦略を採用し、深い層の結果が浅い層に影響を与えるようにする。
  • 特徴の逆変換を適用して、翻訳された深層特徴から生成された画像を可視化し、定性的および定量的評価を可能にする。

実験結果

リサーチクエスチョン

  • RQ1事前学習済み分類ネットワークの深層特徴が、大規模な幾何的変形を伴う効果的なクロスドメイン画像翻訳を可能にするか?
  • RQ2深層特徴上で段階的・深層から浅層への翻訳戦略が、オブジェクトポーズやインスタンス数といった意味的整合性を、形状翻訳中に保持できるか?
  • RQ3エンドツーエンドの画像間翻訳と比較して、特徴レベルでの翻訳は、形状変形タスクにおけるFIDスコアと視覚的品質でどのように差を示すか?
  • RQ4VGG-19から得た事前学習済み特徴が、追加の監視なしに、クロスドメイン翻訳を支援する意味的に意味のある表現をどれだけ捉えているか?
  • RQ5zebraからgiraffe、またはelephantからzebraのような極端な形状差を示す未ペアドメインペアに対しても、本手法は一般化可能か?

主な発見

  • 提案手法は、6つのクロスドメイン翻訳タスクのうち5つで最高のFIDスコアを達成し、cat ↔ dog では67.58 / 46.02、zebra ↔ giraffe では67.41 / 39.38 のスコアを記録した。
  • zebra ↔ elephant 翻訳では、FIDスコアが68.45 / 47.86 に達し、CycleGAN(86.55 / 68.44)やMUNIT(109.56 / 80.1)を顕著に上回った。
  • 定性的な結果から、象の首を伸ばす、シマウマの頭を小さくするといった顕著な幾何的変形を実現しながらも、オブジェクトポーズや構図を保持していることが確認された。
  • 最終層の全結合層特徴のt-SNE可視化から、翻訳された特徴がターゲットドメインの分布に最も近いことが示され、意味的整合性が裏付けられた。
  • 形状の相違度が高い挑戦的なドメインペアに対しても、本手法は良好に一般化し、部分的オクルージョンやクロッピングの状況下でもオブジェクトレベルの意味的整合性を維持した。
  • 成功を収めた一方で、VGG-19の非可逆性や特徴レベルでの誤差拡大のため、背景のコンテンツや小さなオブジェクト部分の保持に失敗することが時折あった。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。