[論文レビュー] Rotate-and-Render: Unsupervised Photorealistic Face Rotation from Single-View Images
本稿では、屋外データのみを用いて、単一のビューからの写真のようにリアルな顔の回転を実現する、非教師ありフレームワーク「Rotate-and-Render」を提案する。3D顔メッシュを任意のポーズに回転させ、元のポーズに戻して再レンダリングすることで、GANを介してレンダリング出力を実写画像分布に変換する。これにより、ペairedデータやラベルが不要であるにもかかわらず、最先端のアイデンティティ保持性能と合成品質を達成する。
Though face rotation has achieved rapid progress in recent years, the lack of high-quality paired training data remains a great hurdle for existing methods. The current generative models heavily rely on datasets with multi-view images of the same person. Thus, their generated results are restricted by the scale and domain of the data source. To overcome these challenges, we propose a novel unsupervised framework that can synthesize photo-realistic rotated faces using only single-view image collections in the wild. Our key insight is that rotating faces in the 3D space back and forth, and re-rendering them to the 2D plane can serve as a strong self-supervision. We leverage the recent advances in 3D face modeling and high-resolution GAN to constitute our building blocks. Since the 3D rotation-and-render on faces can be applied to arbitrary angles without losing details, our approach is extremely suitable for in-the-wild scenarios (i.e. no paired data are available), where existing methods fall short. Extensive experiments demonstrate that our approach has superior synthesis quality as well as identity preservation over the state-of-the-art methods, across a wide range of poses and domains. Furthermore, we validate that our rotate-and-render framework naturally can act as an effective data augmentation engine for boosting modern face recognition systems even on strong baseline models.
研究の動機と目的
- 既存の手法が一般化性や解像度に制限を受ける、顔の回転における高品質なペアドトレーニングデータの欠如に対処する。
- Multi-PIE や 300W-LP といった制御されたマルチビュー・データセットに依存する教師あり手法のドメインおよび解像度の制限を克服する。
- ペアドデータやアイデンティティラベルが一切不要な状態で、屋外の単一ビュー画像のみを用いて、任意の角度での写真のようにリアルな顔の回転を実現する。
- 3D回転・レンダリングのサイクルを通じて自己教師信号を生成し、アイデンティティと詳細を保持しながらリアルな結果を生成する。
- 生成された顔が、強力なベースラインを用いた大規模顔認識ベンチマークで、訓練データの増強として効果的に機能し、性能向上を示すことを実証する。
提案手法
- 単一の2D顔画像から3Dメッシュを再構築するために、市販の3D顔フィッティングネットワーク(3DDFA)を用いる。
- 3Dメッシュを任意のターゲットポーズに回転させ、再び2Dにレンダリングすることで、自己教師信号を生成する。
- メッシュを元のポーズに戻し、回転させた画像から抽出したテクスチャを用いて再レンダリングすることで、欠損領域を含む再構築画像を生成する。
- 画像対画像変換ネットワーク(GANに基づく)を適用し、不完全なレンダリング画像を実写画像ドメインの写真のようにリアルな画像にマッピングする。
- マルチスケールディスクリミネータとVGG特徴損失を活用し、特に極端なポーズ下でもリアルさと詳細の保持を向上させる。
- ペアドデータやアイデンティティアノテーションが一切不要な完全な非教師学習により、パイプライン全体をエンドツーエンドで訓練する。
実験結果
リサーチクエスチョン
- RQ1ペアドマルチビュー・データやいかなる形の監視も行わず、写真のようにリアルな顔の回転を達成できるか?
- RQ23Dメッシュの回転とレンダリングが、高精細でアイデンティティを保持する顔画像の生成に強力な自己教師信号として機能できるか?
- RQ3本手法は、ドメイン特化のファインチューニングなしに、多様な屋外画像および任意の回転角度に一般化できるか?
- RQ4生成された顔が、強力なベースラインモデルを用いても、大規模顔認識システムの性能向上にどの程度寄与できるか?
- RQ53D事前知識とGANベースの変換の組み合わせが、従来の再構築ベースやGANベースのフロントライゼーション手法をどのように上回るか?
主な発見
- 提案された Rotate-and-Render フレームワークは、LFW で FID スコア 83.1、IJB-A で 70.9 を達成し、既存の非教師あり手法を上回る最先端のスコアを実現した。
- MegaFace ベンチマークにおいて、ResNet-50 のランク1正解率を 1M の干渉者を伴い 98.44% まで向上させ、ArcFace R100 モデルを上回った。
- MS1MV2 や ResNet-18 といった強力なベースラインを用いても、生成された顔を用いた訓練データ増強により、MS1MV2 で最高 0.48% の認識正解率向上が達成された。
- アブレーションスタディにより、極端なポーズ下でも高精細な結果を得るには、VGG損失とマルチスケールディスクリミネータの両方が不可欠であることが確認された。
- 本手法は、±90° を含むすべてのテストポーズで、最小限のアーティファクトと強力なアイデンティティ保持を伴い、ほぼ写真のようにリアルな結果を生成した。
- フレームワークは完全に非教師学習であり、ペアドデータ、ラベル、アイデンティティ情報が一切不要であるため、任意の屋外画像コレクションの利用が可能である。
より良い研究を、今すぐ始めましょう
論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。
クレジットカード登録不要
このレビューはAIが作成し、人間の編集者が確認しました。