Skip to main content
QUICK REVIEW

[論文レビュー] Facial Pose Estimation by Deep Learning from Label Distributions

Zhaoxiang Liu, Zezhou Chen|arXiv (Cornell University)|Apr 30, 2019
Face recognition and analysis参考文献 54被引用数 4
ひとこと要約

本論文は、ラベル分布学習としてポーズ回帰をモデル化し、不均衡データセットにおける一般化を向上させるためにガウスラベル分布損失を用いる深層学習的手法を提案する。AFLWおよび300W-LPでこの損失関数を用いてCNNを訓練することで、AFLW2000 や BIWI などのベンチマークで平均絶対誤差(MAE)を最大13.8%まで低減し、最先端の性能を達成した。

ABSTRACT

Facial pose estimation has gained a lot of attentions in many practical applications, such as human-robot interaction, gaze estimation and driver monitoring. Meanwhile, end-to-end deep learning-based facial pose estimation is becoming more and more popular. However, facial pose estimation suffers from a key challenge: the lack of sufficient training data for many poses, especially for large poses. Inspired by the observation that the faces under close poses look similar, we reformulate the facial pose estimation as a label distribution learning problem, considering each face image as an example associated with a Gaussian label distribution rather than a single label, and construct a convolutional neural network which is trained with a multi-loss function on AFLW dataset and 300W-LP dataset to predict the facial poses directly from color image. Extensive experiments are conducted on several popular benchmarks, including AFLW2000, BIWI, AFLW and AFW, where our approach shows a significant advantage over other state-of-the-art methods.

研究の動機と目的

  • AFLW や 300W-LP などの既存のデータセットにおける大規模な顔のポーズのための訓練データ不足の課題に対処する。
  • 隣接するポーズ間の類似性を活用できない標準的なソフトマックス交差エントロピー損失の限界を克服する。
  • 離散的な単一ラベルではなく、連続的な分布としてポーズラベルをモデル化することで、ポーズ推定の精度を向上させる。
  • ラベル分布学習にガウス制約を組み込むことで、特にレアなポーズや大規模なポーズに対してモデルのロバスト性と一般化性能が向上することを示す。

提案手法

  • 各顔画像が真のポーズを中心とするガウス分布ラベルに関連付けられるラベル分布学習問題に顔のポーズ推定を再定式化する。
  • 真のポーズに近づき、隣接するポーズに対して滑らかに減少するよう促進する、新しいガウスラベル分布損失を定義する。
  • ガウスラベル分布損失と標準的な回帰損失を組み合わせたマルチ損失関数を用いて畳み込みニューラルネットワークを訓練する。
  • RGB画像に対して、AFLWおよび300W-LPデータセットのデータを用いて、ヨー、ピッチ、ロール角度の直接回帰を実現するエンドツーエンドの訓練を実施する。
  • ガウス分布の幅を制御するハイパーパrameter α を導入し、局在化の精度と一般化の間のトレードオフを可能にする。
  • 訓練されたモデルを、AFLW2000、BIWI、AFLW、AFW などの複数のベンチマークでテストし、ヨー、ピッチ、ロール、およびMAEメトリクスを用いて性能を評価する。

実験結果

リサーチクエスチョン

  • RQ1単一ラベルではなくラベル分布として顔のポーズをモデル化することで、不均衡データセットにおける性能向上が達成できるか?
  • RQ2隣接するポーズ間のガウスベースの類似性制約を組み込むことで、特に代表が不足している大規模なポーズの推定誤差が低減するか?
  • RQ3標準的なソフトマックス交差エントロピー損失および回帰損失と比較して、提案手法のラベル分布損失は、ロバスト性と精度の面で優れているか?
  • RQ4AFLW2000、BIWI、AFW などの多様なベンチマークにわたって、この手法の一般化性能はどの程度高いか?
  • RQ5ロール推定におけるパフォーマンス向上がヨーとピッチに比べて小さい理由は何か?これはデータの不均衡に起因するのか?

主な発見

  • 提案手法はAFLW2000ベンチマークで最先端の性能を達成し、最良のベースライン(Hopenet)と比較してMAEを13.8%低減した。
  • BIWIベンチマークでは、ピッチで19.4%、ヨーで20.8%のMAE低減を達成し、全体で13.8%のMAE低減を実現した。
  • AFLWベンチマークでは、最良のモデル(α=0.01)が、ヨー誤差を4.2%、ピッチを9.85%、MAEを5.71%低減した。
  • AFWベンチマークでは、99%を超える精度を達成し、Hopenet や KEPLER を含むすべてのベースラインを上回った。
  • α=0.01 のモデルが、精度と一般化のバランスを最良に保ち、すべてのメトリクスおよびデータセットで一貫した改善を示した。
  • ロール推定におけるパフォーマンスギャップは、ヨーとピッチに比べて顕著に大きく、これはロール領域における極端なデータの不均衡に起因している。AFLWでは65.57%、BIWIでは67.65%の例が±10°の範囲内に存在する。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。