Skip to main content
QUICK REVIEW

[論文レビュー] Unsupervised Image-to-Image Translation Using Domain-Specific Variational Information Bound

Hadi Kazemi, Sobhan Soleymani|arXiv (Cornell University)|Nov 29, 2018
Image Processing Techniques and Applications被引用数 20
ひとこと要約

本稿では、ドメイン固有の変分情報バインドを用いてドメイン不変およびドメイン特有の表現を分離する、教師なし画像対画像翻訳フレームワークを提案する。共有コンテンツとモダリティ特有の属性のための別々のコードを学習することで、ペairedデータがなくても一対多の翻訳が可能となり、サンプリングまたはリファレンスガイドド生成によって多様で現実的な出力を達成する。

ABSTRACT

Unsupervised image-to-image translation is a class of computer vision problems which aims at modeling conditional distribution of images in the target domain, given a set of unpaired images in the source and target domains. An image in the source domain might have multiple representations in the target domain. Therefore, ambiguity in modeling of the conditional distribution arises, specially when the images in the source and target domains come from different modalities. Current approaches mostly rely on simplifying assumptions to map both domains into a shared-latent space. Consequently, they are only able to model the domain-invariant information between the two modalities. These approaches usually fail to model domain-specific information which has no representation in the target domain. In this work, we propose an unsupervised image-to-image translation framework which maximizes a domain-specific variational information bound and learns the target domain-invariant representation of the two domain. The proposed framework makes it possible to map a single source image into multiple images in the target domain, utilizing several target domain-specific codes sampled randomly from the prior distribution, or extracted from reference images.

研究の動機と目的

  • ドメインが著しく異なる場合に、共有潜在空間モデルがモダリティ特有の情報を捉えられないとされる限界に対処すること。
  • ドメイン不変コンテンツとドメイン特有の属性の分離表現を学習することで、ペairedデータがなくても一対多の翻訳を可能にすること。
  • ドメイン特有の変分情報バインドを最大化することで、ペairedデータがなくても翻訳の多様性と現実性を向上させること。
  • 翻訳画像にドメイン特有の特徴がエンコードされるサイクル整合性に起因する問題を克服することにより、性能と安定性を向上させること。

提案手法

  • フレームワークは、ソース画像からドメイン不変コードとドメイン特有コードを抽出する2つのエンコーダーを用いる。
  • ジェネレータは、ドメイン不変コードと、単位正規事前分布からサンプリングされた、またはリファレンス画像から抽出されたターゲットドメイン特有コードを用いて、ターゲットドメインの画像を合成する。
  • ソースドメイン特有コードとソース画像の間の相互情報量の最大化により、ドメイン特有特徴の意味的な分離が保証される。
  • ソースドメイン特有コードと翻訳されたターゲット画像の間の相互情報量の最小化により、ドメイン特有特徴がターゲットにエンコードされにくくなり、サイクル整合性に起因するアーティファクトが低減される。
  • ドメイン不変およびドメイン特有コードの両方の再構成パスを通じてサイクル整合性が強制され、構造的および意味的整合性が保証される。
  • 損失関数には、ドメイン特有の変分情報バインドが含まれており、これはモデルが解釈可能で分離されたモダリティ特有コンテンツ表現を学習することを促進する。

実験結果

リサーチクエスチョン

  • RQ1ドメイン不変およびドメイン特有の特徴の分離表現は、教師なし設定における1対多画像翻訳を改善するか?
  • RQ2ペairedデータがなくても、ドメイン特有の変分情報バインドを最大化することで、画像翻訳の多様性と現実性がどのように向上するか?
  • RQ3ドメイン特有およびドメイン不変コードを分離することで、翻訳画像にソース特有の属性がどれほどエンコードされにくくなるか?
  • RQ4ドメインの差が著しいクロスモダリティ翻訳タスクにおいて、本手法はCycleGAN や UNIT のようなサイクル整合モデルを上回るか?
  • RQ5事前分布からのサンプリングまたはリファレンス画像の使用により、ターゲットドメインにおける生成出力の多様性を効果的に制御できるか?

主な発見

  • 本手法は、ドメイン特有コードのサイクル整合性を有効にした場合、スニーカーでLPIPSスコア0.121、ハンドバッグで0.129を達成し、多様性において、アブレーションバージョン(0.095および0.113)を顕著に上回った。
  • FIDスコアがCycleGAN や UNIT よりも低く、実データとの分布の整合性が向上していることを示しており、画像品質および現実性の向上を確認した。
  • ドメイン特有コードのサイクル整合性がなければ、LPIPSの低下によりモード崩壊が生じ、出力の多様性が低下することが示された。
  • アブレーションスタディにより、ドメイン不変コードのサイクル整合性を削除すると、画像品質が著しく低下することが確認され、その理由として不変コードにドメイン特有情報が含まれる可能性が示された。
  • 人間評価において高いだまし成功率を維持しており、生成画像が視覚的に現実的で、実画像と区別がつかないことを示した。
  • ペairedデータや教師信号がなくても、エッジからスニーカー、エッジからハンドバッグなど、異なるドメイン間で多様で現実的な翻訳を効果的に生成できた。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。