[論文レビュー] Eyemotion: Classifying facial expressions in VR using eye-tracking cameras
本稿では、HMDの赤外線眼動追跡画像のみを用いてVR内での顔の表情と顔の運動単位(AUs)を分類するためのEyemotionを提案する。深層畳み込みニューラルネットワーク(CNN)を用い、独自のパーソナライゼーション技術を導入した。5つの感情表現では74%のF1スコア、10個のAUsでは70%のF1スコアを達成し、外部カメラを必要とせず、リアルタイムでの動的アバターのアニメーションを可能にする。
One of the main challenges of social interaction in virtual reality settings is that head-mounted displays occlude a large portion of the face, blocking facial expressions and thereby restricting social engagement cues among users. Hence, auxiliary means of sensing and conveying these expressions are needed. We present an algorithm to automatically infer expressions by analyzing only a partially occluded face while the user is engaged in a virtual reality experience. Specifically, we show that images of the user's eyes captured from an IR gaze-tracking camera within a VR headset are sufficient to infer a select subset of facial expressions without the use of any fixed external camera. Using these inferences, we can generate dynamic avatars in real-time which function as an expressive surrogate for the user. We propose a novel data collection pipeline as well as a novel approach for increasing CNN accuracy via personalization. Our results show a mean accuracy of 74% ($F1$ of 0.73) among 5 `emotive' expressions and a mean accuracy of 70% ($F1$ of 0.68) among 10 distinct facial action units, outperforming human raters.
研究の動機と目的
- 外部カメラを一切使用せずに、HMDによる顔の被覆を解消し、VR内でのリアルタイムの顔の表情分類を可能にすること。
- 内蔵されたHMD眼動追跡器が取得する赤外線眼画像に、顔の表情やAUsを推定するのに十分な情報が含まれることを実証すること。
- 再トレーニングを必要とせず、新しいユーザーに対してCNNの精度を向上させるパーソナライゼーション技術を開発すること。
- ユーザーの推定された顔の表情を反映するリアルタイムな表現豊かなアバターを生成するシステムを構築すること。
提案手法
- 本手法は、HMDの内蔵眼動追跡カメラが取得する低解像度の周図的赤外線画像を用いて、顔の表情とAUsを分類するための畳み込みニューラルネットワーク(CNN)を採用する。
- 独自のパーソナライゼーション手法を導入し、ユーザーの平均的中立眼画像を入力画像から差し引くことで、個々のユーザー間での一般化性能と精度を向上させる。
- モデルは、2つの商用HMDを用いて収集した23名のユーザーを対象とした独自のデータセット上で学習された。表情ラベルは、制御されたセッション中に自己報告により付与された。
- 両目の眼画像をCNNへの入力前に連結することで、左右の顔の動きを統合的にモデル化する。
- システムはリアルタイムでデータを処理し、推定された表情を反映する動的アバターのアニメーションを可能にする。
- 評価では人間によるラベルをベースラインとして用いるが、学習には使用せず、モデルの実世界での表情推定への一般化性能を保証する。
実験結果
リサーチクエスチョン
- RQ1HMDの内蔵眼動追跡カメラが取得する赤外線眼画像のみを用いて、顔の表情と顔の運動単位(AUs)を正確に分類できるか?
- RQ2パーソナライズドな深層学習アプローチは、再トレーニングを必要とせず、新しいユーザーの表情分類精度を向上させることができるか?
- RQ3推定された表情を用いて、VR内でのリアルタイムで表現豊かなアバターを生成し、ユーザーの社会的サブスティチュートとして機能させることができるか?
- RQ4CNNベースの手法の性能は、限られた眼画像からの顔の表情分類において、人間のベースライン精度を上回るか?
主な発見
- 提案されたCNNモデルは、HMDの眼動追跡データのみを用いて、5つの感情表現を分類する際、平均F1スコア0.73(74%の精度)を達成した。
- 10個の顔の運動単位(AUs)の分類においては、平均F1スコア0.68(70%の精度)を達成し、微細な表情認識においても高い頑健性を示した。
- パーソナライゼーション手法により、平均精度が7ポイント向上し、統計的に有意であった(感情表現ではp=0.018、AUsではp=0.001)。
- 両眼画像をネットワークの初期段階で連結する「連結眼アーキテクチャ」は、ホールドアウト参加者において他のアーキテクチャを10ポイント以上上回る性能を示した。
- システムは、眼画像からの表情分類において人間ベースラインの精度を上回り、同様のタスクを実施した熟練した人間レーティング担当者をも上回った。
- 本手法は髪の色やメイクの変化に対して頑健であったが、データ収集中のラベル付けミス(特に左右対称な動作、例:左/右の眉を上げる)が、精度と再現率を低下させる要因となった。
より良い研究を、今すぐ始めましょう
論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。
クレジットカード登録不要
このレビューはAIが作成し、人間の編集者が確認しました。