Skip to main content
QUICK REVIEW

[論文レビュー] Dual Contrastive Learning for Unsupervised Image-to-Image Translation

Junlin Han, Mehrdad Shoeiby|arXiv (Cornell University)|Apr 15, 2021
Cancer-related molecular mechanisms research参考文献 38被引用数 15
ひとこと要約

本稿では、分離されたエンコーダーとプロジェクションヘッドをソースドメインおよびターゲットドメインにそれぞれ用いることで、特徴のアライメントと安定性を向上させる、非教師付き画像対画像翻訳のためのデュアル対照学習フレームワーク、DCLGANを提案する。サイクル整合性制約を回避しつつ、ピクセルレベルの特徴間の相互情報量を最大化することで、最先端の性能を達成し、特にフォト→ラベル翻訳のようなタスクにおいてモード崩壊を顕著に低減する。Cityscapesなどのベンチマークで、教師あり手法との差を埋めるに至った。

ABSTRACT

Unsupervised image-to-image translation tasks aim to find a mapping between a source domain X and a target domain Y from unpaired training data. Contrastive learning for Unpaired image-to-image Translation (CUT) yields state-of-the-art results in modeling unsupervised image-to-image translation by maximizing mutual information between input and output patches using only one encoder for both domains. In this paper, we propose a novel method based on contrastive learning and a dual learning setting (exploiting two encoders) to infer an efficient mapping between unpaired data. Additionally, while CUT suffers from mode collapse, a variant of our method efficiently addresses this issue. We further demonstrate the advantage of our approach through extensive ablation studies demonstrating superior performance comparing to recent approaches in multiple challenging image translation tasks. Lastly, we demonstrate that the gap between unsupervised methods and supervised methods can be efficiently closed.

研究の動機と目的

  • 既存の非教師付き画像対画像翻訳手法の限界、特にモード崩壊と幾何的アウェアネスを要する翻訳における不安定性を解消すること。
  • ソースドメインおよびターゲットドメインに分離されたエンコーダーとプロジェクションヘッドを用いることで、非ペaired画像翻訳における対照学習を改善すること。
  • 幾何的柔軟性を制限し、構造に依存しないタスクで性能を低下させる可能性があるサイクル整合性損失に依存しないようにすること。
  • フォト→ラベル翻訳のようなマルチモーダル翻訳タスクにおけるモード崩壊を効果的に軽減する、変種であるSimDCLを開発すること。
  • 改善された対照的表現学習により、非教師付きと教師あり画像翻訳手法の間の性能差を埋めること。

提案手法

  • DCLGANは、ソースドメインとターゲットドメインそれぞれに特化したエンコーダーとプロジェクションヘッドを別々に用い、ドメイン固有の埋め込みを学習し、特徴のアライメントを向上させる。
  • 本手法は、入力画像と出力画像の対応するピクセル領域間の相互情報量を最大化するための、ピクセル単位のマルチレイヤーPatchNCE損失を用いる。各ドメインに対して別々のプロジェクションを適用する。
  • 両ドメインを同時に処理するデュアル学習設定を採用することで、訓練の安定性を向上させ、ドメイン間での特徴学習を強化する。
  • RGBピクセル特徴量はPatchNCE損失から除外される。これは、最小ピクセルサイズを表し、誤った信号を導入するためであり、収束性が向上する。
  • 外部ネガティブ例は、同じドメインからの特徴スタックを連結することで検討されたが、特徴の融合により画像品質がわずかに低下した。
  • モード崩壊の緩和を目的として、対照的目的関数を変更した変種、SimDCLが導入された。

実験結果

リサーチクエスチョン

  • RQ1分離されたエンコーダーを備えたデュアル対照学習フレームワークは、CUTのような単一エンコーダー手法を上回る性能を発揮するか?
  • RQ2サイクル整合性損失を排除することで、ネズミ→イヌやイヌ→ネズミ翻訳のような幾何的変化を要するタスクで性能が向上するか?
  • RQ3ソースおよびターゲットドメインに分離された埋め込みを用いることで、フォト→ラベル翻訳のようなマルチモーダル翻訳タスクにおけるモード崩壊が軽減されるか?
  • RQ4PatchNCE損失からRGBピクセルを除外することで、対照学習における収束性と性能にどのような影響が生じるか?
  • RQ5対照学習が、非教師付きと教師あり画像翻訳手法の間の性能差をどの程度埋めることができるか?

主な発見

  • DCLGANは、Horse→Zebra、Zebra→Horse、Cityscapesを含む複数の画像翻訳ベンチマークで最先端の性能を達成し、CUTおよびCycleGANを上回った。
  • PatchNCE損失からRGBピクセルを除外することで収束性と性能が向上した。CUTと同様にそれらを含めると、すべてのタスクで性能が劣化した。
  • 単一エンコーダーと共有プロジェクションヘッド(CUTと同様)を用いると性能が悪化し、ドメイン固有の変動を捉えるために分離された埋め込みが不可欠であることが確認された。
  • DCLGANにサイクル整合性損失を追加すると性能が低下し、特に幾何的感度の高いタスクで顕著だった。Cat→DogおよびDog→CatのFIDスコアは、それぞれ71.1および35.5と、DCLGANの元の結果より悪化した。
  • デュアル学習設定は訓練の安定性を著しく向上させ、特徴学習を強化した。これを除去すると性能が劣化した。
  • SimDCLはモード崩壊を効果的に緩和し、フォト→ラベル翻訳において、異なる入力に対して多様で現実的な出力を生成した。これに対してCUTおよびDCLGANは、ほぼ同一の出力を生成した。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。