[論文レビュー] Robust Real-Time Multi-View Eye Tracking
本論文は、複数の目の外観を同時に活用することで、現実世界の条件下でも頑健性を向上させるリアルタイムなマルチカメラ眼追跡フレームワークを提案する。頭部の姿勢と予測された注視行動を考慮した適応的で信頼性に基づく統合メカニズムにより、複数の注視推定値を統合することで、30 fpsで約1°の精度を達成し、単一視点手法と比較して、頭部の動き、眼鏡、照明の変動に対する頑健性が著しく向上する。
Despite significant advances in improving the gaze tracking accuracy under controlled conditions, the tracking robustness under real-world conditions, such as large head pose and movements, use of eyeglasses, illumination and eye type variations, remains a major challenge in eye tracking. In this paper, we revisit this challenge and introduce a real-time multi-camera eye tracking framework to improve the tracking robustness. First, differently from previous work, we design a multi-view tracking setup that allows for acquiring multiple eye appearances simultaneously. Leveraging multi-view appearances enables to more reliably detect gaze features under challenging conditions, particularly when they are obstructed in conventional single-view appearance due to large head movements or eyewear effects. The features extracted on various appearances are then used for estimating multiple gaze outputs. Second, we propose to combine estimated gaze outputs through an adaptive fusion mechanism to compute user's overall point of regard. The proposed mechanism firstly determines the estimation reliability of each gaze output according to user's momentary head pose and predicted gazing behavior, and then performs a reliability-based weighted fusion. We demonstrate the efficacy of our framework with extensive simulations and user experiments on a collected dataset featuring 20 subjects. Our results show that in comparison with state-of-the-art eye trackers, the proposed framework provides not only a significant enhancement in accuracy but also a notable robustness. Our prototype system runs at 30 frames-per-second (fps) and achieves 1 degree accuracy under challenging experimental scenarios, which makes it suitable for applications demanding high accuracy and robustness.
研究の動機と目的
- 大きな頭部の動き、眼鏡、照明の変動といった現実世界の条件下で、既存の眼追跡システムに見られる頑健性の欠如に対処すること。
- 厳しい条件下で特徴が遮蔽されたり歪められたりするため、単一視点眼追跡の限界を克服すること。
- 複数の目の外観にわたる信頼性の高い特徴検出を可能にするリアルタイムでマルチカメラのフレームワークを開発すること。
- 頭部の姿勢と予測された注視行動に基づいて信頼性を算出し、その信頼性に応じて注視推定値を重み付けする適応的統合メカニズムを設計すること。
- アフターチェックや複雑なキャリブレーションを必要としない、制約のない環境でも高い精度と頑健性を示すことを実証すること。
提案手法
- 複数のカメラを用いたマルチビューのカメラセットアップを導入し、遮蔽や歪みが生じても特徴の可視性を高める。
- 各カメラビューの目の画像から、注視関連の特徴(例:虹彩中心、光斑)を個別に抽出する。
- 各ビューに対して、注視推定法(例:クロスレシオベースまたは回帰ベース)を用いて、1フレームあたり複数の注視出力を推定する。
- 一時的な頭部の姿勢と予測された注視行動に基づき、各注視推定値の信頼性スコアを計算する適応的統合メカニズムを実装する。
- 信頼性スコアを用いて重み付けされた統合により、単一の頑健な注視ポイント推定値を生成する。
- リアルタイム性能を最適化し、低解像度(90×50)の目の画像を用いたプロトタイプ実装で30 fpsを達成する。
実験結果
リサーチクエスチョン
- RQ1マルチビュー眼追跡は、単一視点システムと比較して、大きな頭部の動き下でも注視推定の頑健性を向上させることができるか?
- RQ2眼鏡による遮蔽や頭部の動きの影響を受ける状況下で、複数の目の外観を用いることで、特徴検出の信頼性はどのように向上するか?
- RQ3頭部の姿勢と注視予測を考慮した適応的統合メカニズムは、全体の精度と可用性をどの程度向上させるか?
- RQ4低解像度でキャリブレーションなしのマルチカメラセットアップでも、アフターチェックや複雑なキャリブレーションを必要とせず、高精度(≤1°)を達成できるか?
- RQ5照明の変動や多様な目のタイプにわたって、提案されたフレームワークはどの程度の性能を示すか?
主な発見
- 提案されたマルチビューのフレームワークは、厳しい条件下で単一カメラセットアップと比較して、推定精度が約20%(0.2–0.6°)向上し、可用性が10–20%向上する。
- 実世界のシナリオ、特に大きな頭部の動きや眼鏡の使用下でも、平均推定誤差が約1°で、推定可用性がほぼ100%に達する。
- 適応的統合メカニズムにより、通常の条件下で精度が30%向上し、信頼性に基づいて動的に注視推定値を重み付けする。
- システムは30フレーム毎秒で動作し、VR/ARやヒューマンコンピュータインタラクションなどのリアルタイムアプリケーションに適している。
- 照明の変動や被験者間の目のタイプの違いに対しても高い耐性を示し、顕著な性能低下が見られない。
- プロトタイプはアフターチェックを不要としており、低解像度(90×50)の目の画像を用いているが、最小限のハードウェア要件でも高精度が達成可能であることを実証している。
より良い研究を、今すぐ始めましょう
論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。
クレジットカード登録不要
このレビューはAIが作成し、人間の編集者が確認しました。