[論文レビュー] Improved Techniques for GAN based Facial Inpainting
本稿では、より良い初期化のための学習可能パラメトリックネットワークと、動画シーケンスにおける時間的滑らかさ損失を用いることで、再構成品質と最適化速度を向上させるGANベースの顔領域補完手法を提案する。CelebAおよびVidTIMITデータセットにおいて、顔認識の明示的監視なしに、15倍以上の高速化と優れたアイデンティティ保持性を達成し、最先端のモデルを上回る性能を発揮する。
In this paper we present several architectural and optimization recipes for generative adversarial network(GAN) based facial semantic inpainting. Current benchmark models are susceptible to initial solutions of non-convex optimization criterion of GAN based inpainting. We present an end-to-end trainable parametric network to deterministically start from good initial solutions leading to more photo realistic reconstructions with significant optimization speed up. For the first time, we show how to efficiently extend GAN based single image inpainter models to sequences by a)learning to initialize a temporal window of solutions with a recurrent neural network and b)imposing a temporal smoothness loss(during iterative optimization) to respect the redundancy in temporal dimension of a sequence. We conduct comprehensive empirical evaluations on CelebA images and pseudo sequences followed by real life videos of VidTIMIT dataset. The proposed method significantly outperforms current GAN based state-of-the-art in terms of reconstruction quality with a simultaneous speedup of over 15$ imes$. We also show that our proposed model is better in preserving facial identity in a sequence even without explicitly using any face recognition module during training.
研究の動機と目的
- 単一画像設定における非凸最適化によるGANベース顔領域補完の不安定性と収束不良を解消すること。
- 時間的ダイナミクスをモデル化し一貫性を強制することで、単一画像のGANベース顔領域補完を動画シーケンスに拡張すること。
- トレーニング時に顔認識モジュールを明示的に使用せずに、再構成品質と最適化速度を向上させること。
- 時間的滑らかさ損失が単独で顔のアイデンティティをシーケンス全体で効果的に保持できることを示すこと。
- VidTIMITのような実際の顔動画データセットを含む、疑似シーケンスおよび実際の顔動画データセット上で本手法を検証すること。
提案手法
- ランダム初期化に代わって、潜在変数 $ z $ を決定論的に初期化するための学習可能パラメトリックネットワークを提案し、初期再構成品質を向上させる。
- 時間窓内の複数フレームにわたる潜在変数を同時に初期化するための再帰的ニューラルネットワーク(LSTM)を導入し、シーンのダイナミクスを捉える。
- 隣接フレームの最終最適化済み潜在変数がユークリッド空間で近くに位置するように制約する時間的滑らかさ損失を実装する。
- 事前学習済みのGAN生成器と識別器を用いて、知覚的および文脈的損失を計算し、これらの損失の重み付き和によって最適化をガイドする。
- 潜在変数 $ z $ を反復的に精緻化する最適化フレームワークを適用し、$ L_{con}(z|I_d,M) + \eta L_{per}(z) $ を最小化する。新規の構成要素が収束性を向上させる。
- CelebA GANを事前学習した上で、VidTIMITデータに微調整することで、低解像度で現実世界の顔動画分布に適応させる。
実験結果
リサーチクエスチョン
- RQ1学習可能パラメトリック初期化は、ランダム初期化と比較して、GANベース顔領域補完の品質と速度を向上させることができるか?
- RQ2再帰的ネットワークを用いて動画シーケンスの複数フレームにわたる潜在変数を効果的に初期化することで、時間的一致性が向上するか?
- RQ3反復的最適化中に時間的滑らかさ損失を適用することで、顔認識の明示的監視なしに顔のアイデンティティ保持性が向上するか?
- RQ4提案された構成要素は実際の動画データに対してどのように性能を発揮するか?また、合成された疑似シーケンスを超えて汎用性を示せるか?
- RQ5学習可能初期化と時間的滑らかさ損失の組み合わせは、再構成品質と最適化速度の両面で最先端の手法をどれほど上回るか?
主な発見
- 提案手法は、CelebAおよびVidTIMITデータセットにおいて、ベースライン [7] と比較して平均で15倍以上の最適化速度向上を達成した。
- 128×128解像度のVidTIMITデータセットにおいて、提案モデル(LSTM初期化 + スムージング損失)はfjas0被験者で平均PSNRが27.78 dBに達したのに対し、[7] は25.81 dBであった。
- 128×128解像度において、文脈的損失は0.41から0.23に、知覚的損失は0.20から0.11に低下し、再構成品質と現実性の向上を示している。
- 128×128解像度において、FaceNet損失は0.68から0.23に低下し、顔のアイデンティティ保持性の顕著な向上を示している。
- 時間的滑らかさ損失単体でも、顔認識の明示的監視を用いたモデルと同等のアイデンティティ保持性を達成しており、暗黙的アイデンティティモデリングにおける有効性を示している。
- 疑似シーケンスおよび実動画の両方において、[7] よりも優れた視覚的品質を発揮し、定性的な結果ではより写真的で時間的一致性の高い出力を得ている。
より良い研究を、今すぐ始めましょう
論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。
クレジットカード登録不要
このレビューはAIが作成し、人間の編集者が確認しました。