Skip to main content
QUICK REVIEW

[論文レビュー] L2CS-Net: Fine-Grained Gaze Estimation in Unconstrained Environments

Ahmed A. Abdelrahman, Thorsten Hempel|arXiv (Cornell University)|Mar 7, 2022
Gaze Tracking and Assistive Technology被引用数 5
ひとこと要約

L2CS-Net は、非制約的環境における精度と一般化性能を向上させるために、2つの同一で二重損失のブランチを用いて、ヨー角とピッチ角を別々に回帰する、新しいCNNベースの視線推定モデルを提案する。視線のビン予測にソフトマックス層を介した交差エントロピー分類損失とℓ₂回帰損失を組み合わせることで、MPIIGazeで3.92°の平均角誤差、Gaze360で10.41°の平均角誤差を達成し、最先端の性能を実現した。

ABSTRACT

Human gaze is a crucial cue used in various applications such as human-robot interaction and virtual reality. Recently, convolution neural network (CNN) approaches have made notable progress in predicting gaze direction. However, estimating gaze in-the-wild is still a challenging problem due to the uniqueness of eye appearance, lightning conditions, and the diversity of head pose and gaze directions. In this paper, we propose a robust CNN-based model for predicting gaze in unconstrained settings. We propose to regress each gaze angle separately to improve the per-angel prediction accuracy, which will enhance the overall gaze performance. In addition, we use two identical losses, one for each angle, to improve network learning and increase its generalization. We evaluate our model with two popular datasets collected with unconstrained settings. Our proposed model achieves state-of-the-art accuracy of 3.92° and 10.41° on MPIIGaze and Gaze360 datasets, respectively. We make our code open source at https://github.com/Ahmednull/L2CS-Net.

研究の動機と目的

  • 照明、頭部ポーズ、目の外見の変動が顕著に顕在する非制約的環境における視線推定の精度を向上させること。
  • 多様な現実世界の条件下での一般化に限界を示す単一損失のCNNの課題を解決すること。
  • 別々の全結合層を用いてヨーとピッチの回帰を分離することで、各角度の予測精度を向上させること。
  • 視線ビンの分類と回帰を組み合わせた二重損失機構により、ネットワークの一般化性能を向上させること。
  • MPIIGaze および Gaze360 の2つの主要な非制約的データセットを用いた、耐久性の検証を行うこと。

提案手法

  • ImageNetで事前学習されたResNet-50バックボーンを用いて、目の画像や顔の画像からの特徴抽出を行う。
  • ヨー角とピッチ角を独立して予測するために、2つの別々の全結合層を採用し、各角度ごとに微調整を可能にする。
  • 二重損失戦略を採用:各視線角度は、ℓ₂回帰損失と離散的視線ビンにおける交差エントロピー損失の組み合わせによって監視される。
  • 視線ビンの確率を予測するためにソフトマックス層を用い、角度予測誤差に対するロバストネスを向上させる。
  • 回帰部と分類部を同時にバックプロパゲートすることで、両方の損失を共同で最適化する。
  • 訓練中に回帰係数(β)を調整し、2つの損失成分のバランスを最適化し、最良の性能を達成する。
Fig. 1 : L2CS-Net with combined classification and regression losses.
Fig. 1 : L2CS-Net with combined classification and regression losses.

実験結果

リサーチクエスチョン

  • RQ1ヨー角とピッチ角の別々の回帰が、非制約的環境における視線推定精度を向上させることができるか?
  • RQ2回帰損失と分類損失を組み合わせることで、照明、ポーズ、目の外見の多様な条件下でのモデルの一般化性能が向上するか?
  • RQ3提案された二重損失アーキテクチャは、単一損失ベースラインと比較して、耐久性と精度の面で優れているか?
  • RQ4ソフトマックスを用いた視線ビン分類は、現実世界のシナリオにおける角度予測の安定性を向上させることができるか?
  • RQ5非制約的環境における視線推定において、回帰損失と分類損失の最適なトレードオフは何か?

主な発見

  • L2CS-Net は、表1に記載されたすべての先行手法を上回る、MPIIGazeデータセットで3.92°の最先端の平均角誤差を達成した。
  • Gaze360データセットでは、前方180°評価で10.41°の平均角誤差を達成し、新たな最先端ベンチマークを樹立した。
  • Gaze360の前方セットでは、L2CS-Net が9.02°の平均角誤差を達成し、制限された視線範囲においてもその耐久性をさらに示した。
  • MPIIGazeにおける被験者別評価では、L2CS-Net は15名中11名の被験者で FARE-Net を上回り、個々の被験者における性能向上を確認した。
  • アブレーションスタディの結果、視線ビン分類を組み合わせた二重損失機構が一般化性能の向上と角誤差の低減に顕著に寄与することが確認された。
  • モデルは、MPIIGazeにおける1人を除いた交差検証とGaze360の標準的分割を用いた検証を通じて、多様な条件下でも優れた性能を維持した。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。