[論文レビュー] Adversarial Open Domain Adaptation for Sketch-to-Photo Synthesis
本論文は、実際のスケッチと合成スケッチの間のドメインギャップを低減するために、ランダムミックスサンプリング戦略を用い、同時にスケッチからフォトへの変換とフォトからスケッチへの変換の両方を学習する、Adversarial Open Domain Adaptation (AODA) と呼ばれる新規フレームワークを提案する。この手法は、トレーニング中に存在しなかったクラスに対しても、未学習クラスのスケッチからフォトへの合成を可能にし、256×256のリアルな高精細画像を生成するという、オープンドメインスケッチからフォトへの翻訳において最先端の性能を達成している。
In this paper, we explore open-domain sketch-to-photo translation, which aims to synthesize a realistic photo from a freehand sketch with its class label, even if the sketches of that class are missing in the training data. It is challenging due to the lack of training supervision and the large geometric distortion between the freehand sketch and photo domains. To synthesize the absent freehand sketches from photos, we propose a framework that jointly learns sketch-to-photo and photo-to-sketch generation. However, the generator trained from fake sketches might lead to unsatisfying results when dealing with sketches of missing classes, due to the domain gap between synthesized sketches and real ones. To alleviate this issue, we further propose a simple yet effective open-domain sampling and optimization strategy to "fool" the generator into treating fake sketches as real ones. Our method takes advantage of the learned sketch-to-photo and photo-to-sketch mapping of in-domain data and generalizes it to the open-domain classes. We validate our method on the Scribble and SketchyCOCO datasets. Compared with the recent competing methods, our approach shows impressive results in synthesizing realistic color, texture, and maintaining the geometric composition for various categories of open-domain sketches. Our code is available at https://github.com/Mukosame/AODA
研究の動機と目的
- トレーニングデータに存在しないオープンドメインのクラスに対するスケッチからフォトへの翻訳の課題に対処すること。
- トレーニングに使用される実際の手書きスケッチと合成スケッチの間のドメインギャップを低減すること。
- 写真データとドメイン内スケッチ・フォトペアのみを用いて、未学習のカテゴリに一般化可能なスケッチからフォトへの翻訳を可能にすること。
- スケッチからフォトへの翻訳とフォトからスケッチへの翻訳を統合的に学習し、忠実度と幾何的整合性を向上させる統一フレームワークの開発すること。
提案手法
- ドメイン内スケッチ・フォトペアを用いて、スケッチからフォトへの変換器とフォトからスケッチへの変換器を同時に学習するデュアルサイクル GAN フレームワークを提案する。
- トレーニング中に偽のスケッチ(フォトからスケッチへの翻訳から得たもの)と実際のスケッチをランダムに混合するオープンドメインサンプリング戦略を導入し、ドメインシフトを低減する。
- フォトからスケッチの変換器を活用して、オープンドメインのクラスのための妥当な手書きスケッチを合成し、ゼロショットのスケッチからフォトへの翻訳を可能にする。
- インスタンス正規化と残差ブロックを用いた敵対的訓練により、生成画像の構造的およびテクスチャ的詳細を保持する。
- クラスラベルを条件とする GAN を用いて生成をガイドし、多様なカテゴリ間で意味的整合性を向上させる。
- 敵対的損失、サイクル整合性損失、アイデンティティ損失を用いて、エンドツーエンドでモデルを訓練し、リアルで幾何的に正確な出力を保証する。

実験結果
リサーチクエスチョン
- RQ1トレーニング用スケッチが存在しない未学習クラスに対し、スケッチからフォトへの翻訳モデルは一般化可能か?
- RQ2実スケッチと合成スケッチの間のドメインギャップをどのように低減すれば、生成品質が向上するか?
- RQ3スケッチからフォトへの翻訳とフォトからスケッチへの翻訳の共同学習は、オープンドメインスケッチからフォトへの翻訳におけるゼロショット一般化を向上させられるか?
- RQ4偽スケッチと実スケッチのランダムミックスサンプリングは、未学習クラスの生成フォトの耐性およびリアリズムを向上させるか?
- RQ5提案手法は、高解像度(256×256)のフォトリアリスティックな画像を、正確なテクスチャと幾何的構成で生成できるか?
主な発見
- QMUL-Sketch データセットでは、AODA は最高のユーザープ references コンバージョンスコア(74.80%)を達成し、FID(142.6)と分類精度(88.5%)においてもオープンドメインサンプルで2番目に優れた結果を得た。
- SketchyCOCO では、AODA はユーザースタディーで EdgeGAN や条件付き CycleGAN を上回り、オープンドメインクラスにおいても競争力のある FID と精度を達成した。
- 本手法は、羊や giraffe といった未学習クラスに対しても、詳細なテクスチャと保存された幾何的構成を持つリアルな 256×256 画像を効果的に合成できた。
- ユーザースタディーでは、AODA はベースライン手法よりも顕著に好まれており、特にオープンドメインスケッチにおいて、リアリズムと構造的忠実度の向上が示された。
- フォトからスケッチの変換器は高品質なスケッチ抽出を生成し、既存のスケッチ抽出手法を上回る性能を示した。
- Scribble データセットの全範囲での結果では、AODA は標準的なマルチクラススケッチからフォトへの生成でも競争力ある性能を示し、そのロバスト性を確認した。

より良い研究を、今すぐ始めましょう
論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。
クレジットカード登録不要
このレビューはAIが作成し、人間の編集者が確認しました。