Skip to main content
QUICK REVIEW

[論文レビュー] Do Inpainting Yourself: Generative Facial Inpainting Guided by Exemplars

Wanglong Lu, Hanli Zhao|arXiv (Cornell University)|Feb 13, 2022
Generative Adversarial Networks and Image Synthesis被引用数 4
ひとこと要約

本論文では、例示画像を用いて現実的で高品質な顔貌属性の補完をガイドする生成的顔面補填フレームワークである EXE-GAN を提案する。グローバルな画像スタイル、確率的潜在コード、および例示ベースの属性スタイルを、新しい属性類似度メトリクスと空間可変勾配誤差逆伝播を用いて統合することで、自然な遷移と正確な属性転送を実現し、CelebA-HQ および FFHQ データセットにおいて最先端の手法を上回る性能を達成した。

ABSTRACT

We present EXE-GAN, a novel exemplar-guided facial inpainting framework using generative adversarial networks. Our approach can not only preserve the quality of the input facial image but also complete the image with exemplar-like facial attributes. We achieve this by simultaneously leveraging the global style of the input image, the stochastic style generated from the random latent code, and the exemplar style of exemplar image. We introduce a novel attribute similarity metric to encourage networks to learn the style of facial attributes from the exemplar in a self-supervised way. To guarantee the natural transition across the boundaries of inpainted regions, we introduce a novel spatial variant gradient backpropagation technique to adjust the loss gradients based on the spatial location. Extensive evaluations and practical applications on public CelebA-HQ and FFHQ datasets validate the superiority of EXE-GAN in terms of the visual quality in facial inpainting.

研究の動機と目的

  • 例示画像を用いてユーザーがガイドする属性転送を伴う現実的な顔面補填の課題に取り組むこと。
  • 入力顔面画像のアイデンティティとグローバルな一貫性を保持しつつ、例示に類似した属性で欠損領域を補完すること。
  • 補填境界でアーチファクトや不一致を避けて、自然な視覚的遷移を確保すること。
  • スタイリング編集、属性転送、遮蔽された顔の回復など、インタラクティブでアプリケーション向けの顔面編集を可能にすること。
  • 自己教師付き属性類似度メトリクスと空間可変勾配誤差逆伝播技術を導入し、訓練の安定性と現実性を向上させること。

提案手法

  • EXE-GAN は、入力画像のグローバルスタイル、ランダムな潜在コードからの確率的スタイル、および参照画像からの例示ベーススタイルを統合するマルチスタイル生成器を採用する。
  • スタイルエンコーダーが例示画像から潜在表現を抽出し、それらを入力画像のグローバルスタイルと確率的コードと組み合わせてスタイルミキシングを実行する。
  • 明示的なラベルなしで例示画像からの顔貌属性スタイルを学習するための自己教師付き属性類似度メトリクスを新たに導入する。
  • 空間位置に応じて勾配の流れを調整する空間可変勾配誤差逆伝播層(SVGL)を設計し、訓練中に境界付近のアーチファクトを低減する。
  • 敵対的損失、知覚的 LPIPS 損失、アイデンティティ損失、および属性固有の損失を統合した訓練目的を採用し、視覚的忠実性と属性の一貫性を確保する。
  • ランダム性を活用することで、同じマスク入力と例示画像から多様な妥当な出力を得られるようにし、推論の多様性を支援する。

実験結果

リサーチクエスチョン

  • RQ1生成的顔面補填モデルは、アノテーションなしで例示画像から顔貌属性スタイルを自己教師付きで効果的に学習・転送できるか?
  • RQ2高い視覚的リアリズムを維持しつつ、顔面補填における境界アーチファクトをどのように最小化できるか?
  • RQ3属性転送の過程で、入力画像のアイデンティティとグローバル構造をどの程度保持できるか?
  • RQ4スケッチベースのスタイリング編集やガイド付きスタイルミキシングのようなインタラクティブでユーザー主導の編集をフレームワークがサポートできるか?
  • RQ5ベンチマークデータセットにおいて、視覚的品質と属性忠実度の観点から、本手法は最先端の手法と比較してどの程度優れているか?

主な発見

  • CelebA-HQ および FFHQ データセットにおいて、定性的および定量的評価を通じて、EXE-GAN は最先端の手法を上回る優れた視覚的品質を達成した。
  • 提案された属性類似度メトリクスにより、人為的ラベルなしで例示画像からの顔貌属性スタイルを効果的に自己教師付きで学習でき、属性転送の正確性が向上した。
  • 空間可変勾配誤差逆伝播技術により、マスク境界における視覚的アーチファクトが顕著に低減され、より自然で滑らかな補填結果が得られた。
  • フレームワークは局所的な顔貌属性転送を成功裏に実現し、例示画像のガイドに従って目の大きさ、口の形、髪型などの特定の特徴を編集可能となった。
  • マスクやサングラスによる遮蔽された顔の復元についても、Lyu 他らのサングラス除去手法を含め、先行手法を上回った。特に複雑な遮蔽状況でも優れた性能を示した。
  • 潜在ノイズとトランキュレーションを活用することで、同じ入力から多様で確率的な出力を得られるようになり、ユーザーが好みの結果を選択できるようになった。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。