Skip to main content
QUICK REVIEW

[論文レビュー] A Vector-based Representation to Enhance Head Pose Estimation

Zhiwen Cao, Zongcheng Chu|arXiv (Cornell University)|Oct 14, 2020
Face recognition and analysis参考文献 41被引用数 4
ひとこと要約

本稿では、オイラー角やクaternionの不連続性を克服するため、3つの正規直交ベクトル(左、下、前面)を用いたベクトルベースの表現を提案する。新たな損失関数であるベクトルの平均絶対誤差(MAEV)と、正規直交性を満たすように制約を課したニューラルネットワーク(TriNet)を導入し、AFLW2000およびBIWIデータセットで最先端の性能を達成。特に側顔ビューの誤差が顕著に低減された。

ABSTRACT

This paper proposes to use the three vectors in a rotation matrix as the representation in head pose estimation and develops a new neural network based on the characteristic of such representation. We address two potential issues existed in current head pose estimation works: 1. Public datasets for head pose estimation use either Euler angles or quaternions to annotate data samples. However, both of these annotations have the issue of discontinuity and thus could result in some performance issues in neural network training. 2. Most research works report Mean Absolute Error (MAE) of Euler angles as the measurement of performance. We show that MAE may not reflect the actual behavior especially for the cases of profile views. To solve these two problems, we propose a new annotation method which uses three vectors to describe head poses and a new measurement Mean Absolute Error of Vectors (MAEV) to assess the performance. We also train a new neural network to predict the three vectors with the constraints of orthogonality. Our proposed method achieves state-of-the-art results on both AFLW2000 and BIWI datasets. Experiments show our vector-based annotation method can effectively reduce prediction errors for large pose angles.

研究の動機と目的

  • 頭部ポーズ推定に用いられるオイラー角およびクaternionのラベルにおける不連続性問題を解消すること。
  • 特に大きなポーズ角において実際の推定性能をより適切に反映できる新たな評価指標、MAEV(ベクトルの平均絶対誤差)を提案すること。
  • 3つの正規直交ベクトル(頭部ポーズを表す)を予測する深層畳み込みニューラルネットワーク(TriNet)を構築すること。
  • 従来のオイラー角ベース手法がジンバルロックやラベルの不連続性のため失敗する、側顔ビューの性能を向上させること。

提案手法

  • 回転行列から導出される3つの正規直交ベクトル(左:赤、下:緑、前面:青)を用いて頭部ポーズを表現する。
  • 正規直交性を微分可能損失制約によって強制する、CNNベースのネットワーク(TriNet)を訓練し、これらの3つのベクトルを直接予測する。
  • 予測値と真値のベクトル間の角度差に基づく新たな損失関数を導入し、MAEV指標を構築する。
  • キャプセル層の出力に一様サンプリングを適用することで、特徴表現と予測精度を向上させる。
  • 300W-LPを学習データセットとし、AFLW2000およびBIWIデータセットでMAEおよびMAEV指標を用いて評価する。
  • 訓練中に予測ベクトルが正規直交性を保つように、微分可能な直交制約正則化損失を適用する。

実験結果

リサーチクエスチョン

  • RQ1オイラー角やクaternionにおける不連続性を解消できるように、頭部ポーズのベクトル表現が有効であるか?
  • RQ2従来のオイラー角のMAEと比較して、提案されたMAEV指標が、頭部ポーズ推定性能の評価においてより正確かつ信頼性があるか?
  • RQ33つの正規直交ベクトルを予測するように訓練された深層ニューラルネットワークは、特に側顔ビューなど大きなポーズ角においてより優れた性能を示せるか?
  • RQ4直交性制約とベクトルベース損失の導入により、頭部ポーズ推定における一般化性能とロバスト性がどのように向上するか?

主な発見

  • 提案されたベクトルベースのラベル表現は、オイラー角とは異なり、類似したポーズ(例:側顔ビュー)に対しても一貫性のある表現を実現する。
  • MAEV指標はより正確な性能評価を可能にし、側顔画像では予測誤差がわずか2.249°にまで低下する一方、オイラー角のMAEは誤解を招くほど高い44.2°に達する。
  • BIWIデータセットでは、TriNetがMAE 4.23°、MAEV 2.81°という最良の性能を達成し、すべてのベースライン手法を上回った。
  • 誤差解析の結果、MAEVはポーズ角度の増加に伴いMAEほど急激に増加せず、MAEが大きなポーズ推定に不適切であることが裏付けられた。
  • アブレーションスタディの結果、特徴マッピング、キャプセルモジュール、直交性損失の組み合わせが最良の性能をもたらし、キャプセル層における非一様サンプリングの導入がさらなる性能向上をもたらした。
  • 本手法は、FSA-Net や Hopenet が任意の結果を出力する側顔ビューにおいても、顕著に予測誤差を低減し、高い精度を維持した。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。