Skip to main content
QUICK REVIEW

[論文レビュー] Semantics-Aware Image to Image Translation and Domain Transfer

Pravakar Roy, Nicolai Häni|arXiv (Cornell University)|Apr 3, 2019
Generative Adversarial Networks and Image Synthesis参考文献 46被引用数 8
ひとこと要約

本稿では、共通のエンコーダ・デコーダアーキテクチャとクロスドメインの一貫性およびオブジェクト変容損失を用いて、ドメイン間で画像とそのセマンティックラベルを同時に翻訳する、セマンティックに配慮した画像対画像翻訳フレームワークであるSemGANを提案する。翻訳中にセマンティック構造を保持することで、SemGANは教師なしドメイン適応において最先端の性能を達成し、GTA5からCityscapesへの翻訳において平均IoUで5.4%、ピクセル精度で13.5%の優位性を示した。

ABSTRACT

Image to image translation is the problem of transferring an image from a source domain to a different (but related) target domain. We present a new unsupervised image to image translation technique that leverages the underlying semantic information for object transfiguration and domain transfer tasks. Specifically, we present a generative adversarial learning approach that jointly translates images and labels from a source domain to a target domain. Our main technical contribution is an encoder-decoder based network architecture that jointly encodes the image and its underlying semantics and translates both individually to the target domain. Additionally, we propose object transfiguration and cross-domain semantic consistency losses that preserve semantic labels. Through extensive experimental evaluation, we demonstrate the effectiveness of our approach as compared to the state-of-the-art methods on unsupervised image-to-image translation, domain adaptation, and object transfiguration.

研究の動機と目的

  • セマンティックセグメンテーションタスクにおける合成画像と現実世界の画像の間のドメインギャップを解消すること。
  • 幾何的およびスタイルの変化が生じる状況下でも、教師なし画像対画像翻訳中にセマンティックの一貫性を維持すること。
  • 画像とその対応するセマンティックラベルを同時に翻訳することで、ドメイン適応の性能を向上させること。
  • 従来のGANベースの手法が翻訳中にラベルの一貫性を維持できないという限界を克服すること。
  • ドメイン間でセマンティックの一貫性を強制することで、効果的なオブジェクト変容を実現すること。

提案手法

  • 共通のエンコーダネットワークが、入力画像とそのセマンティックラベルマップを共通の潜在表現に同時にエンコードする。
  • 2つの別個のデコーダネットワークが、共通の潜在コードから翻訳済み画像と対応するセマンティックラベルマップを再構築する。
  • 再構築の忠実性とドメイン移行性を保証するため、モデルはサイクル一貫性損失で訓練される。
  • クロスドメインのセマンティック一貫性損失により、翻訳済み画像とその予測ラベルがドメイン間で意味的に整合していることを保証する。
  • オブジェクト変容損失により、ドメイン移行中に個々のオブジェクトの構造的一致性が強制される。
  • 全体の目的関数は、敵対的損失、再構築損失、ドメイン一貫性損失、および変容損失を組み合わせ、共同最適化を実現する。

実験結果

リサーチクエスチョン

  • RQ1画像とセマンティックラベルを同時に翻訳することで、セマンティックセグメンテーションにおけるドメイン適応性能が向上するか?
  • RQ2提案されたクロスドメインセマンティック一貫性損失は、翻訳中にオブジェクトレベルの意味的構造をどれほど効果的に維持できるか?
  • RQ3オブジェクト変容損失を含めることで、未知のドメインシフトに対してより良い一般化性能が得られるか?
  • RQ4セグメンテーション精度およびIoUの観点から、SemGANは最先端の教師なし画像対画像翻訳手法と比べてどのように差をつけるか?
  • RQ5合成から現実世界のストリートシーンへの翻訳において、モデルはどれほど意味的忠実性を維持できるか?

主な発見

  • SemGANは、GTA5からCityscapesへのドメイン適応ベンチマークで77.39%の平均IoUを達成し、次に優れた手法よりも5.4ポイント高い性能を示した。
  • モデルは、次に優れた手法の8.21%から比べて21.71%までピクセル精度を向上させ、13.5ポイントの改善を達成した。
  • クロスドメインセマンティック一貫性損失(L_dom)を除去すると、平均IoUが8ポイント低下し、その重要性が示された。
  • アブレーションスタディの結果、クロスドメイン一貫性損失のみで平均IoUが8%、ピクセル精度が23%向上した。
  • 定性的な結果から、SemGANが生成する画像は、CycleGAN、UNIT、SG-GANと比較して、オブジェクトの形状とセマンティック構造をよりよく保持していることが明らかになった。
  • モデルは実写同士の翻訳に対しても良好に一般化しており、ペアデータが存在しない状況でも強力な性能を示した。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。