Skip to main content
QUICK REVIEW

[論文レビュー] GazeDirector: Fully Articulated Eye Gaze Redirection in Video

Erroll Wood, Tadas Baltrušaitis|arXiv (Cornell University)|Apr 27, 2017
Gaze Tracking and Assistive Technology参考文献 6被引用数 7
ひとこと要約

GazeDirectorは、分析・合成を用いてマルチパーツ眼領域モデルを適合させることで、人物に依存しない動画内の視線誘導を3次元モデルベースのアプローチで実現する。視線のターゲットを完全に3次元的にアーティキュレート可能であり、モデルから導出されたフロー場を用いてまぶたをワープし、合成された3次元角膜を合成することで、視認性に優れた結果を達成。視線誘導角度が大きい場合でも、従来のワープのみの手法に比べ、精度と視覚的品質の両面で優れている。

ABSTRACT

Abstract We present GazeDirector, a new approach for eye gaze redirection that uses model‐fitting. Our method first tracks the eyes by fitting a multi‐part eye region model to video frames using analysis‐by‐synthesis, thereby recovering eye region shape, texture, pose, and gaze simultaneously. It then redirects gaze by 1) warping the eyelids from the original image using a model‐derived flow field, and 2) rendering and compositing synthesized 3D eyeballs onto the output image in a photorealistic manner. GazeDirector allows us to change where people are looking without person‐specific training data, and with full articulation, i.e. we can precisely specify new gaze directions in 3D. Quantitatively, we evaluate both model‐fitting and gaze synthesis, with experiments for gaze estimation and redirection on the Columbia gaze dataset. Qualitatively, we compare GazeDirector against recent work on gaze redirection, showing better results especially for large redirection angles. Finally, we demonstrate gaze redirection on YouTube videos by introducing new 3D gaze targets and by manipulating visual behavior.

研究の動機と目的

  • 個々のユーザーのキャリブレーションやトレーニングデータを必要とせず、人物に依存しない視線誘導を動画で実現すること。
  • 従来のフローに基づく手法の角度オフセット制限を克服し、新しい3次元視線方向を正確に指定できること。
  • 視線誘導における視覚的品質を向上させ、特に大きな誘導角度の場合のアーティファクトを低減すること。
  • 多様な照明、ポーズ、目の外観を有する実世界のYouTube動画において、実用的な応用が可能であることを示すこと。

提案手法

  • 分析・合成を用いて、3次元可塑的目領域モデルを動画フレームに適合させ、形状、テクスチャ、ポーズ、視線、照度を同時に回復する。
  • GPUアクセラレーテッドラスタライゼーションを用いて、スパarsely定義された頂点変位から密な光学フロー場を計算し、まぶたの変形をモデル化する。
  • フロー場を入力画像のまぶたに適用し、視線誘導中に顔の構造を保持する。
  • 適合された3次元目のモデルを用いて、視覚的にリアルな3次元角膜モデルを合成し、出力画像に合成する。
  • モデル適合の過程で収束を加速するために2次最適化戦略を採用し、効率性と正確性を向上させる。
  • Unityを用いて物理シミュレーションと手続き的プログラミングを活用し、実世界の動画応用向けに3次元視線ターゲットを定義する。

実験結果

リサーチクエスチョン

  • RQ13次元モデルベースのアプローチは、個人に特化したトレーニングデータを必要とせず、正確かつ視覚的にリアルな視線誘導を達成できるか?
  • RQ2特に大きな視線誘導角度において、モデルベースの視線誘導はフローフィールドベースの手法と比較して、視覚的品質とアーティファクト抑制の面で優れているか?
  • RQ3提案手法は、多様な実世界の動画環境(変動する頭部ポーズや照明)においても、安定した視線推定と誘導を達成できるか?
  • RQ4角膜とまぶたの両方の誘導を組み合わせることで、単一のコンponentのみを用いる場合と比較して、全体の誘導品質がどの程度向上するか?

主な発見

  • Columbia視線データセットにおいて、GazeDirectorはヨー方向で3.13°、ピッチ方向で6.92°の視線推定誤差を達成し、ヨー方向では従来手法を上回りつつ、データセットに依存しない性能を維持している。
  • 1次最適化手法と比較して、同じ1イタレーションあたりの計算量であるにもかかわらず、2次最適化の採用により、モデル適合プロセスがより速く、より低い誤差で収束する。
  • モデル適合の各イタレーションにおいて、画像再構成誤差と視線推定誤差が減少しており、分析・合成戦略の有効性が裏付けられている。
  • 角膜とまぶたの両方の誘導を追加することで、誘導なしの状態と比較して、画像差分誤差が20%低減され、フルパイプラインが最小の誤差を達成している(図13を参照)。
  • GazeDirectorは、多様な目の外観、頭部ポーズ、照明を有するYouTube動画においても、視線誘導を成功裏に実行し、実世界の環境におけるロバストネスを示している。
  • 実用デスクトップ環境では、モデル適合が11.6–12.5 fps、視線誘導が80 fpsの実行速度を達成し、ニアリアルタイム処理が可能である。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。