[論文レビュー] GEDDnet: A Network for Gaze Estimation with Dilation and Decomposition
GEDDnet は、拡張畳み込みを用いて微細な目の外見の変動を捉え、被験者に依存しない gaze 予測と被験者に依存するバイアスに分離する gaze 分解法を組み合わせた、目線推定のための新規な深層学習フレームワークを提案する。1枚または数枚のターゲット画像での最小限のキャリブレーションにより、最先端の精度を達成し、誤差を最大35.6%まで低減し、キャリブレーションなしでも従来手法を6.3%以上上回る性能を発揮する。
Appearance-based gaze estimation from RGB images provides relatively unconstrained gaze tracking from commonly available hardware. The accuracy of subject-independent models is limited partly by small intra-subject and large inter-subject variations in appearance, and partly by a latent subject-dependent bias. To improve estimation accuracy, we propose to use dilated-convolutions in a deep convolutional neural network to capture subtle changes in the eye images, and a novel gaze decomposition method that decomposes the gaze angle into the sum of a subject-independent gaze estimate from the image and a subject-dependent bias. To further reduce estimation error, we propose a calibration method that estimates the bias from a few images taken as the subject gazes at only a few or even just a single gaze target. This significantly redues calibration time and complexity. Experiments on four datasets, including a new dataset we collected containing large variations in head pose and face location, indicate that even without calibration the estimator already outperforms state-of-the-art methods by more than 6.3%. The proposed calibration method is robust to the location of calibration target and reduces estimation error significantly (up to 35.6%), achieving state-of-the-art performance with much less calibration data than required by previously proposed methods.
研究の動機と目的
- RGBベースの目線推定における大きな被験者間および小さな被験者内での外見的変動の課題に対処すること。
- 被験者がターゲットを見る画像を1枚または数枚のみ使用することで、キャリブレーション時間と複雑さを低減し、被験者に依存するバイアスを推定すること。
- 目線を被験者に依存しない成分と被験者に依存する成分の和としてモデル化することで、推定精度を向上させること。
- 従来の手法よりも著しく少ないキャリブレーションデータで最先端の性能を達成すること。
提案手法
- 多様な頭部ポーズや顔貌の下でも、目の画像における微細な空間的変動を捉えるために、深層畳み込みニューラルネットワークに拡張畳み込みを採用する。
- 画像特徴から得られる被験者に依存しない成分と、被験者に依存するバイアスに分離する gaze 分解機構を導入する。
- 被験者がターゲットを見る1枚または数枚のキャリブレーション画像のみを用いて、被験者に依存するバイアスを推定するキャリブレーション手法を設計する。
- 予測された gaze 角と真値の間の誤差を最小化する損失関数を用いて、ネットワークをエンドツーエンドで訓練する。
- 頭部ポーズや顔の位置に大きな変動を含む新しいデータセットを用いて、頑健性と一般化性能を評価する。
実験結果
リサーチクエスチョン
- RQ1拡張畳み込みを用いることで、微細な目の外見的詳細を捉えることにより、目線推定の精度が向上するか?
- RQ2目線を被験者に依存しない成分と被験者に依存する成分に分離することで、被験者間での一般化性能が向上するか?
- RQ31枚または数枚の画像のみでキャリブレーションを大幅に簡素化できるか、かつ精度に悪影響を及げないか?
- RQ4精度とキャリブレーション効率の観点から、提案手法は最先端の手法と比較してどのように差をつけるか?
主な発見
- キャリブレーションなしでも、GEDDnet は最先端の手法を6.3%以上上回る目線推定精度を達成する。
- 提案されたキャリブレーション手法により、ベースライン手法と比較して推定誤差を最大35.6%まで低減した。
- 従来のアプローチよりも著しく少ないキャリブレーションデータで最先端の性能を達成した。
- キャリブレーションターゲットの位置の変動に対してもモデルが頑健であることが示され、実用的利便性が向上した。
- 頭部ポーズや顔の位置に大きな変動を含む4つのデータセット(新規に収集したデータセットも含む)における実験により、本手法の一般化性能と頑健性が確認された。
より良い研究を、今すぐ始めましょう
論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。
クレジットカード登録不要
このレビューはAIが作成し、人間の編集者が確認しました。