Skip to main content
QUICK REVIEW

[論文レビュー] A Coarse-to-Fine Adaptive Network for Appearance-Based Gaze Estimation

Yihua Cheng, Shiyao Huang|arXiv (Cornell University)|Jan 1, 2020
Gaze Tracking and Assistive Technology参考文献 30被引用数 13
ひとこと要約

本稿では、顔画像を用いて粗いがく方向を予測し、目の画像を用いて残差を精緻化する、外見ベースの3次元がく推定のための粗-細粒度適応ネットワークCA-Netを提案する。バイグラムモデルを用いて基本がくと残差を結合し、アテンション機構を用いて左目・右目の特徴量に適応的に重みを割り当てることで、MPIIGaze(4.14°)およびEyeDiapベンチマークで最先端の性能を達成した。

ABSTRACT

Human gaze is essential for various appealing applications. Aiming at more accurate gaze estimation, a series of recent works propose to utilize face and eye images simultaneously. Nevertheless, face and eye images only serve as independent or parallel feature sources in those works, the intrinsic correlation between their features is overlooked. In this paper we make the following contributions: 1) We propose a coarse-to-fine strategy which estimates a basic gaze direction from face image and refines it with corresponding residual predicted from eye images. 2) Guided by the proposed strategy, we design a framework which introduces a bi-gram model to bridge gaze residual and basic gaze direction, and an attention component to adaptively acquire suitable fine-grained feature. 3) Integrating the above innovations, we construct a coarse-to-fine adaptive network named CA-Net and achieve state-of-the-art performances on MPIIGaze and EyeDiap.

研究の動機と目的

  • 既存の外見ベースのがく推定手法が顔画像と目の画像を独立した特徴源として扱うという限界を是正し、それらの内在的相関を無視している点に起因する。
  • 粗い顔特徴と細かい目の特徴の補完的性質を活用することで、のがく推定精度を向上させること。
  • 顔画像と目の画像からのマルチレベル特徴を粗-細粒度の方法で適応的に統合するフレームワークを設計すること。
  • 標準ベンチマーク上でアブレーションおよび比較研究を実施し、提案された粗-細粒度戦略の有効性を検証すること。

提案手法

  • 粗-細粒度戦略を提案:まず顔画像特徴から基本のがく方向を推定し、次に目の画像特徴から予測されたのがく残差を用いて精緻化する。
  • 基本のがく方向と予測されたのがく残差の間の依存関係を明示的にモデル化するため、バイグラムモデルを導入し、残差推定の精度を向上させる。
  • 顔特徴と目の特徴に基づいて、左目・右目の特徴量に適応的に重みを割り当てるアテンション部を採用し、関連する細粒度情報の動的選択を可能にする。
  • 粗-細粒度戦略、バイグラムモデリング、適応的アテンションを統合したエンドツーエンドのディーブラーニングフレームワークとしてCA-Netを構築する。
  • 基本のがく方向とのがく残差をベクトル加算することで、最終のがく予測を生成する。
  • 畳み込みニューラルネットワーク(CNN)を用いて特徴抽出:顔画像用(粗い特徴)と目の画像用(細粒度特徴)の2つのCNNを別々に使用する。

実験結果

リサーチクエスチョン

  • RQ1顔画像と目の画像を階層的に統合する粗-細粒度戦略は、それらを並列入力として扱う手法と比較して、のがく推定精度を向上させることができるか?
  • RQ2バイグラムモデルは、のがく方向とのがく残差の関係をモデル化することで、精緻化の有効性を示すか?
  • RQ3左目・右目の特徴量に適応的に重みを割り当てるアテンション機構は、のがく推定のロバスト性と精度を向上させるか?
  • RQ4のがく推定において、粗-細粒度戦略は逆方向(細粒度-粗い)アプローチよりも効果的か?
  • RQ5MPIIGaze や EyeDiap といった標準ベンチマークにおいて、提案されたCA-Netは既存の最先端手法と比較して優れているか?

主な発見

  • CA-NetはMPIIGazeベンチマークで平均誤差4.14°を達成し、以前の最先端手法を上回った。
  • 粗-細粒度戦略は細粒度-粗いアプローチを著しく上回り、平均誤差で0.49°の改善を示した。
  • バイグラムモデルはワングラムベースラインと比較して0.29°の性能向上を示し、のがく方向-残差の依存関係をモデル化することの価値を裏付けた。
  • 提案されたアテンション部は、顔のみまたは目のみを対象としたアテンションベースラインよりも優れた性能を示し、特徴量重み付けの有効性を確認した。
  • アブレーションスタディの結果、バイグラムモデリングと適応的アテンションの組み合わせが最良の性能を達成し、各コンponent間の相乗効果を検証した。
  • 可視化結果から、CA-Netは顔の姿勢やのがく方向の多様性にわたって良好に一般化しており、のがくが顔中心から逸れるケースに対しても有効であることが確認された。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。