[論文レビュー] Learning Disentangling and Fusing Networks for Face Completion Under Structured Occlusions
本稿では、教師ありデータを必要とせず、綺麗な顔と構造的オクルージョンを分離・融合することで顔の補完を行う、新しい生成的対抗ネットワークであるDF-GANを提案する。顔の補完を、オクルージョン付き顔、綺麗な顔、オクルージョンの3つのドメイン間で分離・融合するプロセスとしてモデル化することで、エンコーダ・デコーダネットワークと二重学習フレームワーク、ドメイン固有の識別器を用い、写真的にリアルでアイデンティティを保持する顔の補完を生成する。4つのMeshfaceデータベースにおいて最先端の性能を達成した。
Face completion aims to generate semantically new pixels for missing facial components. It is a challenging generative task due to large variations of face appearance. This paper studies generative face completion under structured occlusions. We treat the face completion and corruption as disentangling and fusing processes of clean faces and occlusions, and propose a jointly disentangling and fusing Generative Adversarial Network (DF-GAN). First, three domains are constructed, corresponding to the distributions of occluded faces, clean faces and structured occlusions. The disentangling and fusing processes are formulated as the transformations between the three domains. Then the disentangling and fusing networks are built to learn the transformations from unpaired data, where the encoder-decoder structure is adopted and allows DF-GAN to simulate structure occlusions by modifying the latent representations. Finally, the disentangling and fusing processes are unified into a dual learning framework along with an adversarial strategy. The proposed method is evaluated on Meshface verification problem. Experimental results on four Meshface databases demonstrate the effectiveness of our proposed method for the face completion under structured occlusions.
研究の動機と目的
- 従来の方法が教師ありデータの欠如とオクルージョン構造の不十分なモデリングにより失敗する、構造的オクルージョン下での顔の補完という課題に対処すること。
- 顔の補完を単なる画像補填(inpainting)ではなく、綺麗な顔とオクルージョンの分離・融合プロセスとしてモデル化すること。
- 教師なしデータを用いて、オクルージョン付き顔、綺麗な顔、構造的オクルージョンの3つのドメイン間の変換を学習するフレームワークを開発すること。
- メッシュ型オクルージョン下で、高品質でアイデンティティを保持する顔の補完を生成することで、顔認識性能を向上させること。
- 本手法の汎用性を顔の補完を超えて示し、スタイル転送タスクへの応用可能性を示すこと。
提案手法
- 3つのドメインを構築する:オクルージョン付き顔(X)、綺麗な顔(Y)、構造的オクルージョン(Z)、それぞれが異なるデータ分布を表す。
- 分離ジェネレータGは、オクルージョン付き顔を潜在表現にエンコードし、別々のデコーダーを用いて綺麗な顔と構造的オクルージョンにデコードする。
- 融合ジェネレータFは、綺麗な顔とオクルージョンの潜在表現を連結して、新たなオクルージョン付き顔を合成する。
- 分離と融合のプロセスは二重学習フレームワークに基づき統合され、ドメイン間のサイクル整合性が確保される。
- ドメイン固有の識別器(D_X, D_Y, D_Z)を用いて、生成サンプルの現実性を敵対的訓練により強制する。
- 敵対的損失とサイクル整合性損失を用いて、教師あり例が不要なエンドツーエンドの学習が可能となる。
実験結果
リサーチクエスチョン
- RQ1顔の補完は、綺麗な顔と構造的オクルージョンの分離・融合プロセスとして効果的にモデル化可能か?
- RQ2教師ありデータがなくても、GANベースのフレームワークは綺麗な顔とオクルージョンの意味のある分離表現を学習可能か?
- RQ3構造的オクルージョンを明示的にモデリングすることで、顔の補完結果の品質とアイデンティティ保持性が向上するか?
- RQ4学習された表現は、オクルージョン特徴量におけるベクトル演算(例:補間や差分)を可能にし、意味のある操作を可能にするか?
- RQ5提案手法は、構造的オクルージョン下での顔認識性能を向上させるか?
主な発見
- DF-GANは4つのMeshfaceデータベースにおいて最先端の性能を達成し、CycleGANなどのベースライン手法よりも高いPSNRとSSIMスコアを記録した。
- AR、MultiPIE、Color FERET、LFWの各データセットにおいて、表情や照明の変化がある状況下でも、視覚的に妥当でアイデンティティを保持する顔の補完を生成した。
- モデルは制約のない環境にも良好に一般化でき、LFWの低解像度や大アングル画像を含む野生環境下の顔補完にも成功した。
- アブレーションスタディにより、DF-GANはランダムなメッシュパターンの分布を学習していることが確認され、未学習のオクルージョンパターンの分離にも成功しており、記憶による過学習ではないことが示された。
- メッシュ表現におけるベクトル演算により、制御可能なオクルージョンの合成が可能である:補間により中間パターンが生成され、差分により非オクルージョン領域が特定され、潜在空間における線形構造が示された。
- 全データセットにおけるROC曲線は、補完後の顔認識性能の向上を有効に裏付けた。
より良い研究を、今すぐ始めましょう
論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。
クレジットカード登録不要
このレビューはAIが作成し、人間の編集者が確認しました。