[論文レビュー] MagicEyes: A Large Scale Eye Gaze Estimation Dataset for Mixed Reality
本稿では、実際のミックスドリアリティ(MR)デバイスを用いて収集された大規模なアイ gaze 推定データセットである MagicEyes を紹介する。このデータセットには 587 名の被験者、80,000 枚の人がラベル付けした画像、800,000 点を超える gaze ターゲットラベルが含まれる。また、1 回の順伝播で角膜中心、光斑(グレイン)、虹彩、眼領域セグメンテーションを同時に推定するマルチタスク深層学習モデルである EyeNet を提案。従来のヒューリスティックベースのパイプラインと比較して、非軸上アイ画像においてより高いロバスト性と効率性を示した。
With the emergence of Virtual and Mixed Reality (XR) devices, eye tracking has received significant attention in the computer vision community. Eye gaze estimation is a crucial component in XR -- enabling energy efficient rendering, multi-focal displays, and effective interaction with content. In head-mounted XR devices, the eyes are imaged off-axis to avoid blocking the field of view. This leads to increased challenges in inferring eye related quantities and simultaneously provides an opportunity to develop accurate and robust learning based approaches. To this end, we present MagicEyes, the first large scale eye dataset collected using real MR devices with comprehensive ground truth labeling. MagicEyes includes $587$ subjects with $80,000$ images of human-labeled ground truth and over $800,000$ images with gaze target labels. We evaluate several state-of-the-art methods on MagicEyes and also propose a new multi-task EyeNet model designed for detecting the cornea, glints and pupil along with eye segmentation in a single forward pass.
研究の動機と目的
- ミックスドリアリティ(MR)デバイスにおける非軸上アイ gaze 推定のための、大規模で現実世界のデータセットの不足を解消すること。
- 豊富なアノテーションを備えた、実際のデバイスで収集された包括的で大規模なデータセット上で、最先端の手法をベンチマークすること。
- 瞳孔、光斑、角膜、セグメンテーションといった重要な眼の特徴を同時に推定する統合的ディープラーニングフレームワークを構築し、ロバスト性と効率性を向上させること。
- ハイブリッド幾何学的およびヒューリスティックベースのアプローチを凌駕する、エンド・トゥ・エンドの学習ベースの gaze 推定を実現すること。
提案手法
- MagicEyes データセットは、実際の MR デバイスを用いて収集され、587 名の被験者から 640×480 の赤外線(IR)眼画像を、多様な照明条件および文化的背景の下で取得した。
- データセットには、人間による検証済みの眼部位セグメンテーション(顔、くも膜、虹彩、瞳孔)のためのグランドトゥルースを有する 80,000 枚の画像、および 800,000 点を超える gaze ターゲットラベルが付与された画像が含まれる。
- EyeNet は、共有された ResNet-50 + FPN エンコーダーと、眼セグメンテーション、瞳孔および光斑の局所化、角膜中心推定のためのタスク固有のデコーダーを備えたマルチタスク深層ニューラルネットワークである。
- モデルは 1 回の順伝播で複数の出力を予測し、共有特徴を活用することで一般化性能を向上させるとともに、計算コストを低減する。
- ネットワークは教師あり学習と幾何的制約を統合し、微分可能で 3 次元眼モデルを用いて 2 次元予測からの gaze 推定を最適化する。
- 評価にはアブレーションスタディおよび RlTNet や NVGaze といった最先端手法との比較が含まれ、セグメンテーション、瞳孔局所化、gaze 推定の各タスクで実施された。
実験結果
リサーチクエスチョン
- RQ1最先端のアイ gaze 推定手法は、実際のミックスドリアリティデバイスから収集された大規模で現実世界のデータセット上で、どの程度の性能を示すか?
- RQ2マルチタスク深層学習モデルは、個別またはヒューリスティックベースのパイプラインと比較して、眼の特徴(瞳孔、光斑、角膜中心、セグメンテーション)をよりロバストに同時に推定できるか?
- RQ3幾何的事前知識を統合したエンド・トゥ・エンドの学習は、非軸上・現実世界のアイ画像条件下で、gaze 推定の精度をどの程度向上させるか?
- RQ4ハイブリッド幾何学的手法と比較して、現在のエンド・トゥ・エンドのディープラーニングアプローチの限界は何か?
主な発見
- MagicEyes は、実際の MR デバイスを用いて収集された、公開可能な最大規模のアイ gaze 推定データセットであり、587 名の被験者と 800,000 点を超える gaze ターゲットラベルを有する。
- 完全畳み込みネットワークは、眼セグメンテーションおよび瞳孔局所化において優れた性能を示し、現実世界の状況下でも幾何学的アプローチの可能性を示唆した。
- NVGaze などの直接的なエンド・トゥ・エンドのディープラーニング手法は、理想的な条件下では強力な性能を示したが、現実世界の展開には不適切であり、高いばらつきを示した。
- 提案された EyeNet モデルは、角膜中心、光斑、瞳孔、セグメンテーションの同時推定により、手作業によるヒューリスティクスへの依存を低減し、ベースライン手法を上回った。
- 学習プロセスに幾何的制約を統合することで、特に厳しい非軸上視認条件下でも、gaze 推定のロバスト性と正確性が向上した。
- 共有表現を用いたマルチタスク学習により、1 回の推論プロセスで複数の眼関連量をより効率的かつ正確に推定できることが実証された。
より良い研究を、今すぐ始めましょう
論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。
クレジットカード登録不要
このレビューはAIが作成し、人間の編集者が確認しました。