[論文レビュー] GazeCorrection:Self-Guided Eye Manipulation in the wild using Self-Supervised Generative Adversarial Networks
この論文では、ラベルなしのヘッドポーズや目の角度データを必要とせず、画像インpaintingフレームワークを用いて野生の(屋外の)画像における視線補正のための自己教師あり生成対抗ネットワーク、GazeGANを提案する。本手法は、アイデンティティの保持のための角度に依存しない特徴を抽出する自己ガイドド事前学習モデルと、訓練の安定化とリアリズムの向上のための自己教師ありモジュールを採用しており、野生のデータセットにおいて定量的・定性的な両面で最先端の性能を達成している。
Gaze correction aims to redirect the person's gaze into the camera by manipulating the eye region, and it can be considered as a specific image resynthesis problem. Gaze correction has a wide range of applications in real life, such as taking a picture with staring at the camera. In this paper, we propose a novel method that is based on the inpainting model to learn from the face image to fill in the missing eye regions with new contents representing corrected eye gaze. Moreover, our model does not require the training dataset labeled with the specific head pose and eye angle information, thus, the training data is easy to collect. To retain the identity information of the eye region in the original input, we propose a self-guided pretrained model to learn the angle-invariance feature. Experiments show our model achieves very compelling gaze-corrected results in the wild dataset which is collected from the website and will be introduced in details. Code is available at https://github.com/zhangqianhui/GazeCorrection.
研究の動機と目的
- ヘッドポーズや目の角度が大きく変動する野生の画像における視線補正を解決すること。
- 高価なポーズアノテートデータを必要とせず、自己教師あり学習を活用してトレーニングデータの収集を容易にすること。
- 視線操作中に元の目の領域のアイデンティティを角度に依存しない特徴を用いて保持すること。
- 自己教師ありモジュールを用いて、視線補正における敵対的訓練の安定性と品質を向上させること。
- 視認的に説得力があり、多様なヘッドポーズに強く対応できる高精細でリアリスティックな視線補正を達成すること。
提案手法
- 本手法は、生成的敵対ネットワーク(GAN)に基づく完全畳み込み型画像インpaintingモデルを用い、補正された目の領域を合成する。
- アイデンティティ保持のため、元の目の領域から角度に依存しない特徴を抽出するための自己ガイドド事前学習モデルを導入する。
- 生成器は、アイデンティティ保持を保証するために、角度に依存しない特徴で条件付けられる。
- 生成器と判別器の両方に自己教師あり学習モジュールを追加し、左右の目の予測を二値分類損失として用いて訓練の安定化とリアリズムの向上を図る。
- 高精細で視認的にリアリスティックなインpaintingを実現するために、グローバルおよびローカルの判別器アーキテクチャを採用する。
- トレーニングプロセスはエンドツーエンドであり、ペairedの真値目の角度やヘッドポーズアノテーションを必要とせず、野生からのデータ収集が容易になる。
実験結果
リサーチクエスチョン
- RQ1ラベルなしのヘッドポーズや目の角度データを必要とせず、野生の実世界画像において視線補正を効果的に行うことができるか?
- RQ2目の角度やポーズの大きな変動にもかかわらず、元の目の領域のアイデンティティ情報を視線操作中にどのように保持できるか?
- RQ3自己教師あり学習は、視線補正における敵対的訓練の安定性と品質をどの程度向上させるか?
- RQ4提案された自己ガイドド特徴抽出機構は、標準的なGANベースのインpaintingと比較して、顔のアイデンティティをどの程度効果的に保持できるか?
- RQ5既存の最先端の視線補正モデルと比較して、本手法のリアリズムと補正精度の性能はどの程度か?
主な発見
- GazeGANはNewGazeテストセットでInception Score(IS)3.10 ± 0.12、Fréchet Inception Distance(FID)28.34を達成し、GLGAN(IS: 2.87 ± 0.07)とDeepWarpを両方の指標で上回った。
- ユーザースタディーでは、GazeGANが最良の結果として35.40%の票を獲得し、StarGAN(29.60%)、GLGAN(21.87%)、DeepWarp(13.13%)を大きく上回り、優れた視認的リアリズムを示した。
- アブレーションスタディーにより、自己教師あり学習モジュールがすべてのトレーニングイテレーションにおいてISとFIDスコアを向上させ、訓練の安定化と出力品質の向上の有効性が確認された。
- 定性的な結果から、GazeGANは特に極端なヘッドポーズを示す困難な野生の画像において、DeepWarpよりもシャープでよりリアリストな視線補正を生成していることがわかった。
- 自己ガイドド事前学習モデルは、異なる目の角度に対してもアイデンティティ特徴を効果的に保持しており、補正された目の領域における一貫した顔の構造とテクスチャが裏付けられている。
- 補足資料およびプロジェクトページの結果から、多様なヘッドポーズに強く、困難な実世界画像においても一貫した性能を示し、一般化性能が優れていることが示された。
より良い研究を、今すぐ始めましょう
論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。
クレジットカード登録不要
このレビューはAIが作成し、人間の編集者が確認しました。