[論文レビュー] LEyes: A Lightweight Framework for Deep Learning-Based Eye Tracking using Synthetic Eye Images
LEyes は、深層学習に基づく瞳孔追跡のための軽量で合成データ生成フレームワークであり、単純な光分布を用いて瞳孔および角膜反射(CR)位置という唯一の重要な画像特徴をモデル化する。これにより、神経ネットワークの効率的な学習が可能となり、瞳孔およびCR局在化において最先端の性能を達成し、既存の手法や低価格ハードウェア上での商用眼追跡器でさえも上回る。
Deep learning has bolstered gaze estimation techniques, but real-world deployment has been impeded by inadequate training datasets. This problem is exacerbated by both hardware-induced variations in eye images and inherent biological differences across the recorded participants, leading to both feature and pixel-level variance that hinders the generalizability of models trained on specific datasets. While synthetic datasets can be a solution, their creation is both time and resource-intensive. To address this problem, we present a framework called Light Eyes or "LEyes" which, unlike conventional photorealistic methods, only models key image features required for video-based eye tracking using simple light distributions. LEyes facilitates easy configuration for training neural networks across diverse gaze-estimation tasks. We demonstrate that models trained using LEyes are consistently on-par or outperform other state-of-the-art algorithms in terms of pupil and CR localization across well-known datasets. In addition, a LEyes trained model outperforms the industry standard eye tracker using significantly more cost-effective hardware. Going forward, we are confident that LEyes will revolutionize synthetic data generation for gaze estimation models, and lead to significant improvements of the next generation video-based eye trackers.
研究の動機と目的
- 深層学習に基づく注視推定におけるデータ不足とアノテーション負荷の課題に対処するため、合成眼画像を生成すること。
- 実際の眼画像におけるハードウェア的・生物学的変動に起因するドメインシフトを克服し、モデルの汎化性を向上させること。
- 最小限の計算リソースで多様な注視推定タスクに応じた深層学習モデルを訓練可能な、軽量で設定可能なフレームワークを開発すること。
- 実世界の条件にうまく一般化する合成データでモデルを学習させることで、低価格ハードウェア上でも高性能な注視推定を実現すること。
- P-CR眼追跡に必要なキーフィーチャーに焦点を当て、フォトリッチな合成データ生成の代替手段としてスケーラブルで効率的な手法を提供すること。
提案手法
- フォトリッチなレンダリングではなく、単純な光分布を用いて、瞳孔およびCR位置というキービジュアル特徴をモデル化する。
- 実際の眼画像特徴(例:瞳孔の明るさ、CR位置)の統計的分布に基づいて、パラメータ化されたジェネレータを定義し、合成眼画像を生成する。
- 2段階の画像処理パイプラインを採用する:まず、しきい値ベースのセグメンテーションにより瞳孔およびCR中心を局在化し、次にマスク付きカットアウトを用いたCNNベースの最適化を実施する。
- CNN推論の前に、CRカットアウトには48pxの黒い円形マスク、瞳孔カットアウトには瞳孔楕円サイズの1.4倍のグレーの楕円形マスクを適用する。
- LEyes が生成する合成データで神経ネットワークを学習させ、実世界のデータセット上でRMS-S2S精度および注視精度の指標を用いて性能を評価する。
- 3×3の注視グリッドに基づき、2次多項式モデルと1次相互作用を用いて注視信号をキャリブレーションし、精度を向上させる。

実験結果
リサーチクエスチョン
- RQ1最小限の視覚的特徴に基づく軽量な合成データ生成フレームワークが、瞳孔およびCR局在化において最先端の手法と同等またはそれ以上の性能を達成できるか。
- RQ2LEyes が生成する合成データは、異なるハードウェア設定および眼画像における生物学的変動に対してどの程度一般化できるか。
- RQ3LEyes が生成するデータで学習したモデルは、低価格ハードウェアにデプロイされた場合、業界標準の商用眼追跡器を上回る性能を示せるか。
- RQ4LEyes で学習したモデルの性能は、実データセットで学習したモデルと比較して、注視精度および精度の面でどの程度か。
- RQ5フォトリッチなレンダリングではなく、瞳孔およびCRという必須の画像特徴のみを用いることで、モデルの効率性および一般化性能にどのような影響があるか。
主な発見
- LEyes が生成する合成データで学習したモデルは、複数のベンチマークデータセットにおいて、瞳孔およびCR局在化で最先端の性能を達成した。
- LEyes で学習したモデルは、低価格ハードウェア上での業界標準のEyeTrackerを上回り、優れた一般化性と耐障害性を示した。
- LEyes が生成するデータは、多様な記録条件において一貫した性能を発揮し、ハードウェア的・生物学的変動に起因するドメインシフトを低減した。
- フレームワークは、実眼画像データに対して既存の手法と同等またはそれ以上のRMS-S2S精度指標を達成する高い注視推定精度を実現した。
- 合成データ生成プロセスは計算的に効率的であり、最小限のアノテーションで済むため、データ収集およびラベリングコストを顕著に削減した。
- 単純な光分布と特徴固有のマスキングの使用により、複雑でリソースを喰うフォトリッチなレンダリングを必要とせずに、高いモデル性能を達成できた。

より良い研究を、今すぐ始めましょう
論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。
クレジットカード登録不要
このレビューはAIが作成し、人間の編集者が確認しました。