[論文レビュー] Mask-off: Synthesizing Face Images in the Presence of Head-mounted Displays
本論文では、1台の可視光カメラと2台の近赤外線(NIR)眼カメラを用いて、ヘッドマウントディスプレイ(HMD)を装着している状態でも、写真のようにリアルな、遮蔽されていない顔の画像を合成する新規なシステムを提案する。この手法は、個人に合わせた3次元頭部モデリング、顕著な遮蔽下でも頑健な3次元顔追跡、および専用の眼の色調補正と赤目除去パイプラインを用い、遮蔽領域における平均強度誤差が5.6の高精細な顔の表情再構築を実現する。
A head-mounted display (HMD) could be an important component of augmented reality system. However, as the upper face region is seriously occluded by the device, the user experience could be affected in applications such as telecommunication and multi-player video games. In this paper, we first present a novel experimental setup that consists of two near-infrared (NIR) cameras to point to the eye regions and one visible-light RGB camera to capture the visible face region. The main purpose of this paper is to synthesize realistic face images without occlusions based on the images captured by these cameras. To this end, we propose a novel synthesis framework that contains four modules: 3D head reconstruction, face alignment and tracking, face synthesis, and eye synthesis. In face synthesis, we propose a novel algorithm that can robustly align and track a personalized 3D head model given a face that is severely occluded by the HMD. In eye synthesis, in order to generate accurate eye movements and dynamic wrinkle variations around eye regions, we propose another novel algorithm to colorize the NIR eye images and further remove the "red eye" effects caused by the colorization. Results show that both hardware setup and system framework are robust to synthesize realistic face images in video sequences.
研究の動機と目的
- 仮想現実や拡張現実アプリケーションにおいて、ヘッドマウントディスプレイ(HMD)が引き起こす顔の遮蔽問題に対処すること。
- HMDが上顔部を遮蔽する状況下でも、ビデオ会議やマルチプレイヤーゲームにおいてリアルな対面コミュニケーションを可能にすること。
- 部分的な入力から、表情や目の動きを含む完全な顔の外観を再構築するシステムを開発すること。
- アバターに依存するか、大規模な遮蔽に対し高精細性を欠く既存手法の限界を克服すること。
- マルチセンサ入力と高度な3次元モデリング技術を用いて、遮蔽領域の正確で写真のようにリアルな再構築を達成すること。
提案手法
- 可視光RGBカメラ1台と、眼領域に焦点を合わせた近赤外線(NIR)カメラ2台を用いたハードウェア構成を導入し、可視光およびNIRデータを同時に取得する。
- 構造からモーションを用いた手法とパラメトリック顔モデリングを用いて、個人に合わせた3次元顔モデルを構築し、正確な3次元再構築と追跡を可能にする。
- 上顔部がHMDによって著しく遮蔽されている状況下でも、個人に合わせた3次元モデルを頑健に一致・追跡できる新規な3次元頭部追跡アルゴリズムを実装する。
- 顔のランドマークに基づいて事前に記録されたデータベースから最も適合する表情テンプレートを取得し、現在のフレームに合わせて変形する顔合成パイプラインを構築する。
- 2段階の眼合成手法を設計する:まずNIR眼画像をリアルな肌色に色調補正し、次に近赤外線照明に起因する「赤目」アーチファクトを除去する。
- 空間的・時間的整合性を保証するように、キャリブレーションされたフレームワークを通じて、すべてのモジュールを統合する。
実験結果
リサーチクエスチョン
- RQ1可視光および近赤外線カメラを用いたマルチセンサ構成は、HMDによる上顔部の遮蔽下でも完全な顔の外観を効果的に再構築できるか?
- RQ2HMDによる著しい遮蔽下でも、個人に合わせた3次元顔モデルはどの程度正確に追跡され、一致するか?
- RQ3合成された眼領域は、動的な目の動きやしわの変化を含め、実際の顔の詳細をどの程度正確に再現できるか?
- RQ4システムは、正確な顔の表情を保持し、遮蔽領域に視覚的アーチファクトを最小限に抑えた写真のようにリアルな結果を生成できるか?
- RQ5システムの性能オーバーヘッドはどの程度で、リアルタイム動作に最適化可能か?
主な発見
- 合成画像とグランドトゥーとの比較において、遮蔽領域での平均強度誤差が5.6にとどまり、顔のテクスチャ再構築の高精度を示している。
- Microsoft Emotion APIを用いた顔の表情認識では、合成された表情がグランドトゥーとよく一致しており、8つの感情カテゴリにおいて一貫した分類が得られた。
- 顔合成モジュールが最も計算コストが高く、CPU上で1フレームあたり約400msを要しているが、追跡と眼の色調補正ははるかに高速である。
- 近赤外線照明の特異な光学的特性を考慮することで、眼の合成パイプラインは「赤目」効果を効果的に除去し、標準的な赤目除去技術を上回る性能を示した。
- シミュレーションおよびモバイル環境での検証を通じて、多様なユーザーと顔の表情(目や口の動きを含む)に対しても、システムは頑健であることが確認された。
- 実行時解析の結果、GPUアクセラレーションと解像度の低減により、リアルタイム動作が可能になると示唆され、テレビ会議やAR/VRアプリケーションへの実用的導入が現実のものとなった。
より良い研究を、今すぐ始めましょう
論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。
クレジットカード登録不要
このレビューはAIが作成し、人間の編集者が確認しました。