[論文レビュー] Explicit Facial Expression Transfer via Fine-Grained Semantic Representations.
本稿では、中間予測の不正確さを回避するため、元の画像とターゲット画像をペairドでないまま、表情を交換した合成画像に直接マッピングする、新しい顔の表情転送手法を提案する。独創的な敵対的訓練方式により、AU関連およびAU非関連特徴を分離し、交換一貫性を強制することで、多様なアイデンティティ、ポーズ、人口統計的要因をカバーする、写真のようにリアルで細分化された表情転送を実現する。
Facial expression transfer between two unpaired images is a challenging problem, as fine-grained expressions are typically tangled with other facial attributes such as identity and pose. Most existing methods treat expression transfer as an application of expression manipulation, and use predicted facial expressions, landmarks or action units (AUs) of a source image to guide the expression edit of a target image. However, the prediction of expressions, landmarks and especially AUs may be inaccurate, which limits the accuracy of transferring fine-grained expressions. Instead of using an intermediate estimated guidance, we propose to explicitly transfer expressions by directly mapping two unpaired images to two synthesized images with swapped expressions. Since each AU semantically describes local expression details, we can synthesize new images with preserved identities and swapped expressions by combining AU-free features with swapped AU-related features. To disentangle the images into AU-related features and AU-free features, we propose a novel adversarial training method which can solve the adversarial learning of multi-class classification problems. Moreover, to obtain reliable expression transfer results of the unpaired input, we introduce a swap consistency loss to make the synthesized images and self-reconstructed images indistinguishable. Extensive experiments on RaFD, MMI and CFD datasets show that our approach can generate photo-realistic expression transfer results between unpaired images with different expression appearances including genders, ages, races and poses.
研究の動機と目的
- 表情がアイデンティティ、ポーズ、その他の属性と混同されているため、ペアドでない画像間で細分化された顔の表情を転送する課題に対処すること。
- ランドマーク、アクションユニット(AUs)、または表情の予測といった中間的ガイダンスに起因する不正確さが、転送品質を制限するのを克服すること。
- アイデンティティとポーズを保持しながら、表情を交換した画像を合成することで、直接的な表情転送を可能にすること。
- 予測されたAUsに依存せずに、AUs関連およびAUs非関連特徴を分離する堅牢な手法を開発すること。
- 合成画像と自己再構築画像の間の交換一貫性損失を通じて、一貫性とリアルさを確保すること。
提案手法
- 顔の画像におけるAUs関連およびAUs非関連特徴の分離を目的とした、マルチクラス分類問題を解消するための新しい敵対的訓練法を提案する。
- AUs非関連特徴をベース表現とし、ソースおよびターゲット画像間でAUs関連特徴を入れ替えることで、表情を転送した新しい画像を合成する。
- 合成画像とその自己再構築バージョンが区別不能であるように制約を課す交換一貫性損失を導入し、忠実性と一貫性を向上させる。
- ペアドでないソースおよびターゲット画像を入力とし、分離された特徴を用いて表情を交換した2つの合成画像を生成する生成モデルを採用する。
- 画像合成の過程で、アクションユニット(AUs)の意味的表現を活用し、局所的な表情の詳細を明示的に制御する。
- モデルが合成出力から元の画像を再構築できるようにするサイクル一貫性学習目的関数を設計し、耐性を高める。
実験結果
リサーチクエスチョン
- RQ1予測された顔のランドマークやアクションユニット(AUs)に依存せずに、誤差伝搬を避けることのできる明示的表現転送が可能かどうか。
- RQ2ペアドでない画像間変換において、敵対的学習フレームワーク内でAUs関連およびAUs非関連特徴をどれほど効果的に分離できるか。
- RQ3交換一貫性を強制することで、ペアドでない設定下での表現転送のリアルさと正確さがどの程度向上するか。
- RQ4提案手法が、性別、年齢、人種の違いを含む、多様なアイデンティティ、ポーズ、表情の外見に一般化できるか。
- RQ5写真のようにリアルで細分化された表現忠実度という観点から、最先端の表現転送手法と比較して、本手法はどの程度優れているか。
主な発見
- 提案手法は、RaFD、MMI、CFDといったペアドでない画像データセットにおいて、写真のようにリアルな顔の表情転送で最先端のパフォーマンスを達成した。
- 明示的なAUベースの特徴分離を用いることで、予測されたAUsに依存する手法と比較して、細分化された表現転送の正確性が著しく向上した。
- 交換一貫性損失は、再構築忠実度を強制することで、アーティファクトを効果的に低減し、合成画像の視覚的品質を向上させた。
- モデルは、性別、年齢、人種、顔のポーズの違いを含む多様な人口統計的およびポーズの変動にうまく一般化した。
- CFDデータセットにおける定量的評価では、FIDおよびLPIPS指標においてベースライン手法を上回る優れたパフォーマンスを示した。
- アブレーションスタディの結果、敵対的分離および交換一貫性の両コンponentが、高品質な表現転送を達成するために不可欠であることが確認された。
より良い研究を、今すぐ始めましょう
論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。
クレジットカード登録不要
このレビューはAIが作成し、人間の編集者が確認しました。