Skip to main content
QUICK REVIEW

[論文レビュー] Adaptive Feature Fusion Network for Gaze Tracking in Mobile Tablets

Yiwei Bao, Yihua Cheng|arXiv (Cornell University)|Mar 20, 2021
Gaze Tracking and Assistive Technology参考文献 41被引用数 4
ひとこと要約

本論文は、スタックドフィーチャーマップとシーズャー・アンド・エクスカイト(Squeeze-and-Excitation)レイヤーを用いて左目および右目の特徴を適応的に統合する、モバイルタブレット向けの新しいCNNベースの視線追跡手法であるAdaptive Feature Fusion Network(AFF-Net)を提案する。また、顔の外見を用いて眼の特徴を再キャリブレーションするための適応的グループ正規化(Adaptive Group Normalization)を採用している。本手法は、GazeCaptureおよびMPIIFaceGazeデータセットにおいて最先端の性能を達成し、スマートフォンおよびタブレットの画像でそれぞれ1.62 cmおよび2.30 cmのユークリッド誤差を達成した。

ABSTRACT

Recently, many multi-stream gaze estimation methods have been proposed. They estimate gaze from eye and face appearances and achieve reasonable accuracy. However, most of the methods simply concatenate the features extracted from eye and face appearance. The feature fusion process has been ignored. In this paper, we propose a novel Adaptive Feature Fusion Network (AFF-Net), which performs gaze tracking task in mobile tablets. We stack two-eye feature maps and utilize Squeeze-and-Excitation layers to adaptively fuse two-eye features according to their similarity on appearance. Meanwhile, we also propose Adaptive Group Normalization to recalibrate eye features with the guidance of facial feature. Extensive experiments on both GazeCapture and MPIIFaceGaze datasets demonstrate consistently superior performance of the proposed method.

研究の動機と目的

  • 左目と右目の間の構造的類似性を活用することで、モバイルタブレットにおける視線推定の精度を向上させること。
  • 単純な特徴ベクトルの連結による制限を克服し、特徴マップの構造を保持する空間認識統合メカニズムを導入すること。
  • 適応的正規化を用いて顔の外見的特徴(例:頭の向き、照明、個人差)を統合することで、眼の特徉取りを強化すること。
  • 非制約環境下でも頑健な視線推定を実現するため、眼と顔の特徴利用を統合的に最適化するフレームワークを構築すること。

提案手法

  • 本手法は、異なるネットワーク層における左目および右目の特徴マップをスタックすることで、空間的関係を保持し、より効果的な統合を可能にする。
  • スターミングの後に、Squeeze-and-Excitation(SE)レイヤーを適用し、両目の外見的類似性に基づいてチャネルごとの特徴の重要度を適応的に再キャリブレーションする。
  • 顔と眼のバウンディングボックス、および顔の特徴を用いて動的にスケールおよびシフトパラメータを計算する、新規の適応的グループ正規化(AdaGN)レイヤーを導入する。
  • ネットワークは眼と顔の入力をエンドツーエンドで処理し、顔ストリームが眼の特徴表現の精錬に文脈的ガイダンスを提供する。
  • 最終的な視線予測は、統合された眼の特徴から生成され、実世界のモバイルタブレット画像における2次元視線位置誤差を最小化するようにモデルを学習する。
  • アーキテクチャは、2つの大規模データセット(GazeCapture(スマートフォンおよびタブレット)およびMPIIFaceGaze(ラップトップベース))で評価されている。

実験結果

リサーチクエスチョン

  • RQ1特徴ベクトルの連結ではなく、特徴マップをスタックすることで、空間的構造を保持できることにより、視線推定の精度が向上するか?
  • RQ2Squeeze-and-Excitationレイヤーによる適応的チャネル重み付けが、両目の外見的類似性をモデル化することで性能向上をもたらすか?
  • RQ3顔の外見的特徴(例:頭の向き、照明、個人差)を適応的正規化を用いて、眼の特徴学習を効果的にガイドできるか?
  • RQ4顔のサイズが小さかったり、視線方向が変化したりする極端な状況下でも、提案された統合およびガイダンス機構は効果を示すか?

主な発見

  • GazeCaptureデータセットにおいて、AFF-Netはスマートフォン画像で1.62 cm、タブレット画像で2.30 cmのユークリッド誤差を達成し、最先端の手法を上回った。
  • MPIIFaceGazeデータセットでは、3.9 cmのユークリッド誤差と3D視線方向推定における4.4度の角誤差を達成し、ラップトップベースの環境への強い一般化性能を示した。
  • アブレーションスタディの結果、スタッキング、SEレイヤー、AdaGNのいずれかのモジュールを除去すると誤差が約4%増加し、各モジュールの貢献が確認された。
  • ヒートマップ分析から、特にカメラの端付近でも誤差が低く抑えられていることが判明し、より高い頑健性を示した。
  • 顔のサイズが極めて小さい場合でも、ベースラインと比較して顕著に低い誤差を示し、極端な状況下でも優れた一般化性能を示した。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。