[論文レビュー] Automatic Gaze Analysis: A Survey of Deep Learning based Approaches
本サーベイは、自己教師あり、自己教師なし、弱教師ありの手法に焦点を当てた、深層学習に基づく自動視線分析の包括的レビューを提供する。非制約的環境における主な課題を特定し、AR/VR、HCI、コンピュータビジョン応用分野における耐障害的でリアルタイムな視線推定の今後の方向性を提案する。
Eye gaze analysis is an important research problem in the field of Computer Vision and Human-Computer Interaction. Even with notable progress in the last 10 years, automatic gaze analysis still remains challenging due to the uniqueness of eye appearance, eye-head interplay, occlusion, image quality, and illumination conditions. There are several open questions, including what are the important cues to interpret gaze direction in an unconstrained environment without prior knowledge and how to encode them in real-time. We review the progress across a range of gaze analysis tasks and applications to elucidate these fundamental questions, identify effective methods in gaze analysis, and provide possible future directions. We analyze recent gaze estimation and segmentation methods, especially in the unsupervised and weakly supervised domain, based on their advantages and reported evaluation metrics. Our analysis shows that the development of a robust and generic gaze analysis method still needs to address real-world challenges such as unconstrained setup and learning with less supervision. We conclude by discussing future research directions for designing a real-world gaze analysis system that can propagate to other domains including Computer Vision, Augmented Reality (AR), Virtual Reality (VR), and Human Computer Interaction (HCI). Project Page: https://github.com/i-am-shreya/EyeGazeSurvey}{https://github.com/i-am-shreya/EyeGazeSurvey
研究の動機と目的
- 弱教師ありおよび自己教師ありの設定において、深層学習に基づく視線推定およびセグメンテーションの最新の進展を分析すること。
- 限られた教師信号の下で現実世界の非制約的条件下での視線分析に有効な技術を同定すること。
- 視線分析に特化したドメイン固有のメトリクスおよびベンチマークプロトコルを用いて、現在の手法を評価すること。
- AR/VRおよびヒューマンコンピュータインタラクション分野における耐障害的で低遅延の視線推定のための今後の研究方向性を検討すること。
- 従来のモデルベースのアプローチとデータ駆動型の深層学習の間のギャップを埋めるために、ハイブリッド学習フレームワークを提案すること。
提案手法
- 視線推定、セグメンテーション、トラッキングに関する最近の100件以上の研究を系統的レビューした。
- 教師の程度に基づく手法の分類:完全教師あり、弱教師あり、自己教師あり、自己教師なし。
- 主な構成要素の分析:目検出(レジストレーション)、特徴表現(例:CNN、ViTs)、視線予測(回帰または分類)。
- CAVE、MPII、ETH-XGaze、TabletGazeなどの標準ベンチマークを用いて、平均絶対誤差(MAE)および角度誤差などのメトリクスで手法を評価した。
- RGB/IRカメラ、ラップトップ/ウェブカメラ、および専用の眼動追跡装置(例:ビデオオクルーログラフィー)などのデータ収集デバイスのサーベイ。
- コンピュータビジョン、AR/VR、HCI分野からの知見を統合し、幾何学的目のモデルと深層外観特徴を組み合わせたハイブリッドモデルを提案した。
![Figure 1: A brief chronology of seminal gaze analysis works. The very first gaze pattern modelling dates back to the work of Javal et al. in 1879 [ 4 ] . One of the first deep learning driven appearance based gaze estimation models was proposed in $2015$ [ 24 ] .](https://ar5iv.labs.arxiv.org/html/2108.05479/assets/x1.png)
実験結果
リサーチクエスチョン
- RQ1非制約的環境における視線推定に最も効果的な深層学習アーキテクチャとトレーニングパラダイムは何か?
- RQ2自己教師ありおよび弱教師あり手法は、完全教師あり手法と比較して、精度と一般化性能においてどのように異なるか?
- RQ3現実世界における視線推定の主な課題は何であり、現在の手法はそれらをどのように解決しているか?
- RQ4視線方向の単純な推定を超えて、認知的・感情的状態を推定するために視線推論をどのように活用できるか?
- RQ5音声や頭部ポーズなどのマルチモーダルまたはクロスモーダル入力は、視線推定の耐障害性向上に果たす役割は何か?
主な発見
- 自己教師ありおよび自己教師あり手法は、高価で誤差の生じやすい人為的ラベルに依存するのを減らす可能性を示している。
- 現在の最先端モデルは、制御された条件下でETH-XGazeなどのベンチマークデータセットで1.5度未満の平均絶対誤差を達成している。
- 幾何学的目のモデルと深層外観特徴を組み合わせたハイブリッドモデルは、多様な頭部ポーズや照明条件において一般化性能を向上させている。
- 今後の視線軌道予測は、AR/VRアプリケーションにおける低遅延のフェオケートドレンダリングを可能にする重要な要因として浮上している。
- 音声や頭部運動の手がかりを用いたマルチモーダルアプローチは、視界が悪いまたは遮断された状況での視線推定を向上させることができる。
- 進展は見られるものの、極端な頭部ポーズや遮断が生じる非制約的現実世界環境における耐障害性は、依然として主要な未解決課題のままである。

より良い研究を、今すぐ始めましょう
論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。
クレジットカード登録不要
このレビューはAIが作成し、人間の編集者が確認しました。