Skip to main content
QUICK REVIEW

[論文レビュー] Every Smile is Unique: Landmark-Guided Diverse Smile Generation

Wei Wang, Xavier Alameda-Pineda|arXiv (Cornell University)|Feb 6, 2018
Face recognition and analysis参考文献 47被引用数 16
ひとこと要約

本稿では、顔のランドマークを動的表現として活用することで、1枚のニュートラルな顔画像から多様で現実的な笑顔の動画を生成する条件付きマルチモードネットワーク、CMM-Netを提案する。顔のランドマークを埋め込むために変分自己オートエンコーダ(VAE)を用い、表現固有の埋め込みを生成するための条件付きLSTMを採用し、複数のモードを持つ再帰的生成器により、異なるランドマーク系列を生成する。その後、生成された系列を高精細な動画に変換する。本手法は、リアリズムとアクションユニットのダイナミクスにおいて、ベースラインを上回る性能を示す。

ABSTRACT

Each smile is unique: one person surely smiles in different ways (e.g., closing/opening the eyes or mouth). Given one input image of a neutral face, can we generate multiple smile videos with distinctive characteristics? To tackle this one-to-many video generation problem, we propose a novel deep learning architecture named Conditional Multi-Mode Network (CMM-Net). To better encode the dynamics of facial expressions, CMM-Net explicitly exploits facial landmarks for generating smile sequences. Specifically, a variational auto-encoder is used to learn a facial landmark embedding. This single embedding is then exploited by a conditional recurrent network which generates a landmark embedding sequence conditioned on a specific expression (e.g., spontaneous smile). Next, the generated landmark embeddings are fed into a multi-mode recurrent landmark generator, producing a set of landmark sequences still associated to the given smile class but clearly distinct from each other. Finally, these landmark sequences are translated into face videos. Our experimental results demonstrate the effectiveness of our CMM-Net in generating realistic videos of multiple smile expressions.

研究の動機と目的

  • 顔の表情における1対多の動画生成問題に取り組むこと、特に1枚のニュートラルな顔画像から複数の異なる笑顔の動画を生成することを目的とする。
  • 同じ表情クラス(例:自然な笑顔対ポーズ笑顔)内での顔の表情の動的変化(例:目や口の動きの違い)をモデル化すること。
  • 顔のランドマークを通じて表情ダイナミクスを明示的に符号化することで、顔の表情生成のロバスト性とリアリズムを向上させること。
  • 同一のアイデンティティを保ちながら、時間的ダイナミクスが異なる複数の独自の高品質な笑顔シーケンスを生成するフレームワークを構築すること。
  • アバターアニメーション、顔認識、合成データ生成の応用を可能にするために、多様で現実的な表情シーケンスを生成すること。

提案手法

  • 訓練データからの顔のランドマーク系列のコン pact かつ分離可能な埋め込みを学習するために、変分自己オートエンコーダ(VAE)を用いる。
  • 入力としてのニュートラルな顔のランドマークと指定された表情ラベル(例:自然な笑顔、ポーズ笑顔)に条件づけられた、ランドマーク埋め込みの系列を生成するための条件付き再帰的ネットワーク(LSTM)を採用する。
  • 同じ表情クラスに対して、複数の異なるランドマーク埋め込み系列を生成するため、複数の並列LSTMから構成されるマルチモード再帰的生成器を用いる。
  • 生成されたランドマーク系列を、アイデンティティと顔の詳細を保持しながら、現実的な顔の動画を合成するU-Netに類似した画像変換ネットワークに供給する。
  • 敵対的損失、知覚的損失、再構成損失を用いて、エンドツーエンドでモデルを訓練することで、リアリズムと忠実度を確保する。
  • マルチモード生成器には追加の教師信号を必要とせず、潜在空間の確率的性質とマルチヘッド生成により、多様性を学習する。

実験結果

リサーチクエスチョン

  • RQ1同じ入力であっても、1枚のニュートラルな顔画像から複数の異なる、現実的な笑顔の動画を生成できるか?
  • RQ2顔のランドマークをどのように効果的に活用することで、同じクラス内(例:自然な笑顔の異なる目や口の動き)の顔の表情の動的変化をモデル化できるか?
  • RQ3提案手法のランドマーク誘導型マルチモード生成は、標準的な動画生成モデルと比較して、どれほどリアリズムと多様性を向上させるか?
  • RQ4生成された顔の表情ダイナミクス(例:アクションユニット強度)は、実際の人間の表情にどれほど近いか?
  • RQ5条件付きおよびマルチモード再帰的ネットワークの使用により、生成された動画におけるアイデンティティと視覚的品質の保持がどの程度向上するか?

主な発見

  • CMM-Netは、実際のシーケンスと比較して最高のSSIMスコア(0.898)を達成し、ISスコアの差(ΔIS = 0.12)が最小であった。これは、優れた画像品質とリアリズムを示している。
  • ユーザースタディーでは、68.2%の被験者がCMM-Net生成動画をVideo GANのものよりも好むと回答し、65.5%がCRA-Netのものよりも好んだ。これは、より高い認識リアリズムを示している。
  • CMM-Net生成シーケンスにおける頬を上げるアクションユニット(AU)のダイナミクスは、元のデータと非常に近く、UvA-NEMO自然な場合(距離2.234)、UvA-NEMOポーズの場合(距離1.472)の両方で、Video GAN(2.976および2.618)よりも顕著に低い。
  • マルチモード生成器は、同じ表情クラスに対して視覚的に明確に異なるランドマーク系列を効果的に生成しており、視覚的検査および定量的AUダイナミクス分析によって確認された。
  • CMM-Netは、SSIM、IS、およびAUカーブ類似度を含むすべての評価指標で、Video GANおよびCRA-Netを上回り、多様で高品質な動画生成の有効性を示している。
  • モデルは、表情ダイナミクスが異なるにもかかわらず、合成された動画における外見と顔の構造が安定していることから、生成されたシーケンス間でアイデンティティの一貫性を維持していることが裏付けられた。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。