Skip to main content
QUICK REVIEW

[論文レビュー] Deep Generation of Face Images from Sketches

Shuyu Chen, Wanchao Su|arXiv (Cornell University)|Jun 1, 2020
Generative Adversarial Networks and Image Synthesis参考文献 41被引用数 4
ひとこと要約

本論文では、特徴空間における顔の部品多様体(目、鼻、口など)を暗黙的にモデル化することで、粗いまたは不完全なスケッチから高品質で現実的な顔画像を生成する深層学習フレームワーク、DeepFaceDrawingを提案する。ローカルからグローバルへのアプローチを採用し、部品埋め込み、特徴マッピング、画像合成モジュールを統合することで、スケッチをソフト制約として扱い、低品質な入力に対してもユーザーの意図を保持したまま、頑健な合成を実現する。細かな制御も可能である。

ABSTRACT

Recent deep image-to-image translation techniques allow fast generation of face images from freehand sketches. However, existing solutions tend to overfit to sketches, thus requiring professional sketches or even edge maps as input. To address this issue, our key idea is to implicitly model the shape space of plausible face images and synthesize a face image in this space to approximate an input sketch. We take a local-to-global approach. We first learn feature embeddings of key face components, and push corresponding parts of input sketches towards underlying component manifolds defined by the feature vectors of face component samples. We also propose another deep neural network to learn the mapping from the embedded component features to realistic images with multi-channel feature maps as intermediate results to improve the information flow. Our method essentially uses input sketches as soft constraints and is thus able to produce high-quality face images even from rough and/or incomplete sketches. Our tool is easy to use even for non-artists, while still supporting fine-grained control of shape details. Both qualitative and quantitative evaluations show the superior generation ability of our system to existing and alternative solutions. The usability and expressiveness of our system are confirmed by a user study.

研究の動機と目的

  • 高品質なスケッチやエッジマップに類似したスケッチを必要とする従来のスケッチから画像への変換モデルの限界を是正すること。
  • 熟練したスキルが不要な粗い、不完全な、または低スキルの自由なスケッチからも高品質な顔画像を合成できること。
  • 特徴空間における低次元の多様体を用いて、顔の部品形状の妥当な形状を暗黙的にモデル化することで、より頑健で使いやすいシステムを実現すること。
  • 顔全体の整合性を保ちながら、顔の部品形状に対する細かな制御を可能とすること。
  • ユーザースタディおよび顔のモーフィングやコピーペーストなどの実世界の応用を通じて、使いやすさと表現力の評価を行うこと。

提案手法

  • システムは入力スケッチを5つの部品に分解する:左目、右目、鼻、口、残りの部分。各部品は独立して処理される。
  • 部品埋め込み(CE)モジュールは、オートエンコーダーを用いて特徴記述子を学習し、スケッチ部品を潜在空間における部品多様体に射影する。
  • 特徴マッピング(FM)モジュールは、埋め込み済みの部品特徴を32チャネルの特徴マップにマッピングし、情報の流れを向上させるとともに、空間的な統合を可能にする。
  • 画像合成(IS)モジュールは、統合された特徴マップから、条件付きGANに類似したアーキテクチャを用いて最終的な512×512の顔画像を生成する。
  • シャドウガイド付きインターフェースは、スケッチ部品を部品多様体に投影することで、構造的ガイドを得ながら描画を容易にする。
  • フレームワークは、入力スケッチをソフト制約として扱うため、不完全または正確でないストロークに対しても、ユーザーの意図を忠実に再構築できる。

実験結果

リサーチクエスチョン

  • RQ1熟練したスキルが不要な粗いまたは不完全な自由なスケッチから、深層学習モデルが現実的な顔画像を生成できるか。
  • RQ2部品レベルの特徴多様体をどのように暗黙的にモデル化すれば、スケッチ品質への頑健性が向上するか。
  • RQ3部品単位の精錬を伴うローカルからグローバルへのアプローチが、合成品質とユーザー制御をどの程度向上できるか。
  • RQ4局所的な顔の部品編集を可能にしつつ、顔全体の整合性をどのように維持できるか。
  • RQ5提案手法は、定性的および定量的評価において、既存のスケッチから画像への変換モデルを上回る性能を示せるか。

主な発見

  • 提案手法は、粗いまたは不完全なスケッチからでも、高品質で現実的な顔画像(512×512解像度)を生成でき、視覚的品質において既存手法を上回っている。
  • ユーザースタディの結果、システムの使いやすさと表現力が確認され、非芸術家でも最小限の描画スキルで妥当な顔画像を生成できることが示された。
  • システムは、スケッチをハード制約ではなくソフト制約として扱うため、スケッチの不完全さに対する頑健性が向上し、ユーザーの意図を忠実に再現している。
  • 定量的および定性的な評価により、ベースラインおよび代替のスケッチから画像への変換モデルと比較して、優れた性能を示した。
  • 本手法は、顔の部品形状の局所的編集と細かな制御を可能とし、顔のモーフィングやコピーペーストなどの応用が可能である。
  • レイアウトエラーの処理や色の制御における制限は存在するが、構造的事前知識を持つ他のオブジェクトカテゴリへの応用への適応可能性が強く示唆されている。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。