[論文レビュー] Optimization-Based Eye Tracking using Deflectometric Information
本稿では、スクリーン照明によるピクセル密度の高い反射計測を用いて、高精度な視線推定を可能にする最適化ベースの眼追跡手法を提案する。PyTorch3Dを用いた微分可能レンダリングパイプラインにより、鏡面反射をシミュレートし、勾配降下法を用いて眼の回転、並進、形状パラメータを同時に最適化することで、平均相対視線誤差が0.45°未満に抑えられ、シミュレーションにおいて最先端の反射ベース手法を6倍改善した。
Eye tracking is an important tool with a wide range of applications in Virtual, Augmented, and Mixed Reality (VR/AR/MR) technologies. State-of-the-art eye tracking methods are either reflection-based and track reflections of sparse point light sources, or image-based and exploit 2D features of the acquired eye image. In this work, we attempt to significantly improve reflection-based methods by utilizing pixel-dense deflectometric surface measurements in combination with optimization-based inverse rendering algorithms. Utilizing the known geometry of our deflectometric setup, we develop a differentiable rendering pipeline based on PyTorch3D that simulates a virtual eye under screen illumination. Eventually, we exploit the image-screen-correspondence information from the captured measurements to find the eye's rotation, translation, and shape parameters with our renderer via gradient descent. In general, our method does not require a specific pattern and can work with ordinary video frames of the main VR/AR/MR screen itself. We demonstrate real-world experiments with evaluated mean relative gaze errors below 0.45 degrees at a precision better than 0.11 degrees. Moreover, we show an improvement of 6X over a representative reflection-based state-of-the-art method in simulation.
研究の動機と目的
- わずか12点程度のグリント点に依存する疎な反射ベース眼追跡手法の限界を解消すること。
- スクリーン照明からのピクセルレベルの高密度な表面対応を活用して、視線追跡の精度を向上させること。
- 鏡面反射をモデル化し、眼の姿勢と形状の同時最適化を可能にする微分可能レンダリングパイプラインを開発すること。
- 拡張されたスクリーン照明が、疎な点光源に比べてはるかに高密度かつ耐障害性の高い表面情報を提供することを示すこと。
- 高精度かつ低誤差で実世界実験を実施して、本手法の有効性を検証すること。
提案手法
- 本手法は、疎な点光源を、既知の高周波数正弦波パターンを表示する自己発光スクリーンに置き換える。
- 位相シフト技術を用いて、包絡面およびアンラップド位相マップを抽出し、高密度な画像-スクリーン対応を取得する。
- PyTorch3Dに基づく微分可能レンダリングパイプラインにより、スクリーン照明下での仮想眼のシミュレーションを実施し、鏡面反射および光輸送をモデル化する。
- パイプラインは、光度誤差および相関ベースの損失関数を最小化するように、勾配降下法を用いて眼の回転、並進、形状パラメータを同時に最適化する。
- 最適化は、反射計測装置の既知の幾何構造と、取得した対応情報を利用し、3次元眼モデルを精緻化する。
- 本手法は、外部マーカーや特別なハードウェアを必要とせず、標準カメラとスクリーンのみで動作する。
実験結果
リサーチクエスチョン
- RQ1スクリーン照明からの高密度な表面対応は、疎なグリントベース手法と比較して、視線追跡精度を著しく向上させるか?
- RQ2鏡面反射をモデル化する微分可能レンダリングパイプラインは、眼の姿勢と形状推定のための正確な逆レンダリングを可能にするか?
- RQ3対応点の密度が視線推定の精度と誤差に与える影響は何か?
- RQ4単一のカメラビューとVR/AR/MRスクリーンからの標準的な動画フレームのみを用いても、本手法は高精度を達成できるか?
- RQ5照明パターンの選択(例:高周波数対低周波数)が、対応品質と追跡性能に与える影響は何か?
主な発見
- 実世界実験では、平均相対視線誤差が0.42°、精度が0.19°に達し、対応完全度が1/500の条件下で最大誤差1.52°を記録した。
- シミュレーションでは、相関損失を用いた場合0.03°、光度損失を用いた場合0.07°まで誤差を低減し、代表的なグリントトラッキングベースラインと比較して6倍の改善を達成した。
- 対応が疎くなると性能が低下し、対応完全度1/500で平均誤差が1.52°に上昇し、精度が4.52°にまで上昇した。これにより、高密度データの重要性が示された。
- 位相シフトメトロロジーの原則に従い、高周波数正弦波パターンが低周波数パターンよりもより耐障害性があり、正確な対応を提供することが確認された。
- 本手法は、シミュレーションだけでなく実世界テストでもグリントトラッキングを上回り、SIFT特徴点を用いた場合の平均誤差0.15°が、グリントトラッキングの0.20°を下回った。
- 光度損失関数が相関損失よりも優れた一般化性能を示し、実世界環境下での耐障害性の可能性を示唆した。
より良い研究を、今すぐ始めましょう
論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。
クレジットカード登録不要
このレビューはAIが作成し、人間の編集者が確認しました。