Skip to main content
QUICK REVIEW

[論文レビュー] DeepWarp: Photorealistic Image Resynthesis for Gaze Manipulation

Yaroslav Ganin, Daniil Kononenko|arXiv (Cornell University)|Jul 25, 2016
Face recognition and analysis参考文献 23被引用数 10
ひとこと要約

本稿では、学習された強度補正を伴う粗いから細かい空間の歪みを用いた、写真のようにリアルな視線操作を実現する深層順方向ニューラルネットワーク「DeepWarp」を提案する。モデルは、エンドツーエンドで歪み場と照明調整を同時に学習することで、消費者用GPU上で最大20fpsの高精細な視線再配分を実現し、最先端のリアルさと詳細の保持を達成する。

ABSTRACT

In this work, we consider the task of generating highly-realistic images of a given face with a redirected gaze. We treat this problem as a specific instance of conditional image generation and suggest a new deep architecture that can handle this task very well as revealed by numerical comparison with prior art and a user study. Our deep architecture performs coarse-to-fine warping with an additional intensity correction of individual pixels. All these operations are performed in a feed-forward manner, and the parameters associated with different operations are learned jointly in the end-to-end fashion. After learning, the resulting neural network can synthesize images with manipulated gaze, while the redirection angle can be selected arbitrarily from a certain range and provided as an input to the network.

研究の動機と目的

  • 写真のようにリアルな顔の画像における視線再配分を、高い知覚的品質で実現するための深層学習手法の開発。
  • 特徴量の圧縮を避けることで、自己符号化器ベースの手法が抱えるぼやけや平均回帰効果といった限界を解消すること。
  • 指定された範囲内で連続的かつ任意の視線再配分角度を入力として可能にすること。
  • 従来の深層学習および非深層学習手法と比較して、リアルさと微細なディテールの保持を向上させること。
  • ビデオ会議や後期制作などの応用に適した、リアルタイムまたはニアリアルタイムのパフォーマンスを達成すること。

提案手法

  • 視線再配分のための空間的歪み場を予測する、完全畳み込み型の粗いから細かいアーキテクチャを採用。
  • 歪みプロセスをガイドするため、視線再配分角度と顔のキーポoinトマップを補助入力として統合。
  • ピクセルの明るさとコントラストを調整する、学習可能な強度補正モジュールを導入し、鏡面反射やテクスチャディテールの保持を図る。
  • 出力画像と正例画像とのピクセル単位のL2またはL1距離に基づく教師あり損失関数を用いて、エンドツーエンドでネットワークを訓練。
  • 訓練データにおけるわずかな不整合に対してもロバストになるよう、6×6のクロップウィンドウ内で空間的探索を許容するように、損失関数を変更。
  • ボトルネックの圧縮を回避することで、リアルさに不可欠な高周波数ディテールを保持する。

実験結果

リサーチクエスチョン

  • RQ1特徴量の圧縮を回避することで、深層順方向ネットワークが入力特徴を圧縮せずに写真のようにリアルな視線操作を達成できるか。
  • RQ2歪みと強度補正のエンドツーエンド学習は、自己符号化器ベースやランダムフォレストベースの手法と比較して、リアルさとディテール保持においてどのように優れているか。
  • RQ3連続的な範囲内で任意の視線再配分角度に、どの程度一般化できるか。
  • RQ4ヘッドポーズの変化や眼鏡による遮蔽といった状況下でも、モデルの性能はどの程度維持されるか。
  • RQ5単純でコンactなニューラルネットワークは、ランダムフォレストのような大規模で複雑なモデルを上回る品質と効率を達成できるか。

主な発見

  • 視線方向推定のためのユーザー推定精度は平均26.4秒(40秒中)を記録し、ベースライン手法を著しく上回った。
  • ユーザースタディーにおいて、1秒以内の正確な推定が8.1%にのぼり、強い知覚的リアルさを示した。
  • 鏡面反射やテクスチャディテールといった微細なディテールを保持しており、定量的評価でも先行手法より低いMSEと高い知覚的品質を示した。
  • 中級GPU(NVIDIA GeForce 750M)上でも最大20fpsで動作し、リアルタイムパフォーマンスを実現した。
  • ランダムフォレストベースライン(30–60 MB)よりもコンパクト(250 KB)でありながら、優れたリアルさと一般化性能を維持した。
  • 損失関数における空間的探索(拡張されたクロップウィンドウを用いて)により、訓練データにおけるわずかな不整合に対してもロバスト性が向上した。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。