Skip to main content
QUICK REVIEW

[論文レビュー] Mix and match networks: encoder-decoder alignment for zero-pair image translation

Yaxing Wang, Joost van de Weijer|arXiv (Cornell University)|Apr 6, 2018
Generative Adversarial Networks and Image Synthesis参考文献 30被引用数 8
ひとこと要約

本論文は、複数のエンコーダ-デコーダペアを共有潜在空間にアライメントさせることで、ペaired学習データが存在しない状況下でも未学習のドメイン間翻訳を可能にする、ゼロペア画像翻訳のためのフレームワーク「ミックスアンドマッチネットワーク」を提案する。自己オートエンコーダー、補助情報(例:プーリングインデックス)、一貫性損失を活用することで、ゼロショット深度からセマンティックセグメンテーションへの翻訳およびスケーラブルな非ペアスタイル転送において、最先端の性能を達成し、mIoUでCycleGANおよびpix2pixベースラインを2倍以上上回った。

ABSTRACT

We address the problem of image translation between domains or modalities for which no direct paired data is available (i.e. zero-pair translation). We propose mix and match networks, based on multiple encoders and decoders aligned in such a way that other encoder-decoder pairs can be composed at test time to perform unseen image translation tasks between domains or modalities for which explicit paired samples were not seen during training. We study the impact of autoencoders, side information and losses in improving the alignment and transferability of trained pairwise translation models to unseen translations. We show our approach is scalable and can perform colorization and style transfer between unseen combinations of domains. We evaluate our system in a challenging cross-modal setting where semantic segmentation is estimated from depth images, without explicit access to any depth-semantic segmentation training pairs. Our model outperforms baselines based on pix2pix and CycleGAN models.

研究の動機と目的

  • ソースドメインとターゲットドメインの間でペアドトレーニングデータが存在しないゼロペア画像翻訳問題に対処すること。
  • 再トレーニングなしで、学習済みの画像翻訳モデルを未学習のドメインコンbinationsに移行可能にするための手法を提供すること。
  • 多様なモダリティやドメインにわたる一般化を向上させるために、エンコーダーとデコーダーの間のアライメントを強化すること。
  • 非ペア画像翻訳をNドメインにスケーラブルに拡張するため、二乗オーダーから線形オーダーの計算量に削減すること。

提案手法

  • 可用なペアドデータ(例:RGB→深度、RGB→セグメンテーション)に基づいて、複数のエンコーダ-デコーダペアを学習し、共有潜在空間にアライメントする。
  • 自己オートエンコーダーを用いて潜在表現を正則化し、再構成品質を向上させる。
  • 翻訳中に空間的構造を保持するために、プーリングインデックスを補助情報として統合する。
  • 異なるエンコーダーとデコーダー間の表現を一貫性損失でアライメントする。
  • 推論時において、ソースドメイン用エンコーダーとターゲットドメイン用デコーダーを連結することで、未学習の翻訳を構成する。
  • 複数モダリティ(例:RGBと深度)の潜在ベクトルを重み付き平均で融合することで、マルチモーダル入力に対応する。

実験結果

リサーチクエスチョン

  • RQ1限定的なペアドデータで学習されたエンコーダ-デコーダペアを、未学習ドメイン間のゼロペア翻訳を可能にするためにアライメントできるか?
  • RQ2プーリングインデックスなどの補助情報は、ゼロペア翻訳における空間的構造再構成にどのように寄与するか?
  • RQ3一貫性損失とノイズインジェクションは、ドメイン間での移行性をどの程度向上させるか?
  • RQ4従来の非ペア手法と比較して、ミックスアンドマッチフレームワークは多数ドメインに効率的にスケーリング可能か?
  • RQ5本手法は、ペアドトレーニングデータが一切存在しないにもかかわらず、深度からセマンティックセグメンテーションへの挑戦的なクロスモダリティタスクに効果的に一般化できるか?

主な発見

  • 提案手法は、ベースラインと比較して、ゼロペア深度からセマンティックセグメンテーションへの翻訳でmIoUが2倍以上向上(約12%から約27%に)。
  • ミックスアンドマッチネットワークは、pix2pixおよびCycleGANモデルを上回り、特に最良の設定(D→S)では、セマンティッククラスと輪郭を顕著に識別できた。
  • プーリングインデックスとしての補助情報は、特にマルチモーダル設定において再構成品質を向上させ、モダリティ変更に対しても頑健であった。
  • フレームワークにより、スケーラブルな非ペア画像翻訳が実現可能:Nドメインに対しては、N−1個のエンコーダーとN個のデコーダーで十分で、計算量をO(N²)からO(N)に削減した。
  • スタイル転送およびカラー化タスクにおいて、複数のCycleGANに基づくミックスアンドマッチネットワークは、再トレーニングなしで11色および5つの芸術的スタイル間で未学習の翻訳を成功させた。
  • クロスモダリティ一貫性損失と潜在空間へのノイズインジェクションの活用により、ゼロペア設定における性能と一般化能力がさらに向上した。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。