[論文レビュー] SingleGAN: Image-to-Image Translation by a Single-Generator Network using Multiple Generative Adversarial Learning
SingleGANは、ドメインコードと複数の生成的対抗学習を用いた単一生成器GANフレームワークを提案し、複数ドメイン間の画像対画像翻訳を効率的かつ効果的に実現する。未対応データセットにおいて最先端の性能を達成し、1対多、多対多、マルチモーダル翻訳タスクへ一般化し、優れた定性的・定量的結果を示す。
Image translation is a burgeoning field in computer vision where the goal is to learn the mapping between an input image and an output image. However, most recent methods require multiple generators for modeling different domain mappings, which are inefficient and ineffective on some multi-domain image translation tasks. In this paper, we propose a novel method, SingleGAN, to perform multi-domain image-to-image translations with a single generator. We introduce the domain code to explicitly control the different generative tasks and integrate multiple optimization goals to ensure the translation. Experimental results on several unpaired datasets show superior performance of our model in translation between two domains. Besides, we explore variants of SingleGAN for different tasks, including one-to-many domain translation, many-to-many domain translation and one-to-one domain translation with multimodality. The extended experiments show the universality and extensibility of our model.
研究の動機と目的
- 複数の生成器を必要とする従来のマルチドメイン画像翻訳手法における非効率性とスケーラビリティの問題に対処すること。
- ドメイン固有の制御を備えた単一生成器を用いて、効果的かつ効率的な未対応画像対画像翻訳を可能にすること。
- 1対多、多対多、マルチモーダル翻訳を含む多様な翻訳タスクへのフレームワークの一般化を検討すること。
- すべてのトレーニングサンプルに対して詳細なカテゴリラベルを必要としない弱い教師付き学習を、複数の判別器を介して活用することで、ペairedデータや詳細なアノテーションへの依存を低減すること。
- 統一された単一生成器アーキテクチャの柔軟性とスケーラビリティを、さまざまな画像翻訳シナリオにおいて示すこと。
提案手法
- 特定のドメイン間マッピングを条件付けるために、補助入力としてドメインコードを導入する。
- 各ターゲットドメインに対して対抗学習を強制する複数の判別器を採用し、複数の翻訳タスクを同時に学習可能にする。
- 未対応データのトレーニングにおいて、アイデンティティおよび構造の保存を目的にサイクル整合性損失を用いる。
- 属性潜在コードをベースモデルに拡張することで、マルチモーダル生成を可能にし、単一出力翻訳を超えた一般化を実現する。
- ペアドデータに適応するため、サイクル整合性損失をℓ₁再構成損失に置き換えることで、忠実度を向上させる。
- すべてのトレーニングサンプルに対して詳細なカテゴリアノテーションを必要とせず、複数の判別器を介した弱い教師付き学習を適用する。
実験結果
リサーチクエスチョン
- RQ11つの生成器が、各ペアごとに別々の生成器を必要とせずに、複数のドメイン間マッピングを効果的に学習できるか?
- RQ2ドメインコードと複数の判別器は、未対応設定における画像翻訳の性能と一般化をどのように向上させるか?
- RQ3提案フレームワークは、ペアドデータや詳細なアノテーションがなくても、1対多や多対多の複雑なタスクを処理できるか?
- RQ4属性潜在コードの統合が、画像翻訳における生成の多様性をどの程度向上させるか?
- RQ5さまざまな翻訳タスクにおいて、未対応およびペアドデータ設定の両方でモデルはどの程度の性能を示すか?
主な発見
- SingleGANは、最先端の手法と比較して、未対応画像対画像翻訳タスクで優れた性能を達成し、優れた定性的・定量的結果を示した。
- Photo ↔ Artデータセットにおいて、SingleGANは1対多スタイル転送を効果的に実行し、同じ入力画像から異なる芸術的スタイルを生成した。
- Transient-Attributesデータセットでは、不完全なラベルがある中でも、重複するドメイン(例:昼間、夜間、夏、冬)間での一般化に成功した。
- 属性潜在コードの導入により、edge2shoesデータセットでマルチモーダル翻訳が可能になり、同じエッジ入力から多様な靴のスタイルを生成した。
- ペアドデータ設定下でも、SingleGANはℓ₁再構成損失を用いて優れた性能を維持した。DUTS-TRおよびBSDS500データセットで妥当性が確認された。
- モデルは頑健性とスケーラビリティを示し、拡張実験により、多様な画像翻訳タスクにわたる普遍性が確認された。
より良い研究を、今すぐ始めましょう
論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。
クレジットカード登録不要
このレビューはAIが作成し、人間の編集者が確認しました。