Skip to main content
QUICK REVIEW

[論文レビュー] Hybrid coarse-fine classification for head pose estimation

Haofan Wang, Zhenghua Chen|arXiv (Cornell University)|Jan 21, 2019
Face recognition and analysis参考文献 20被引用数 11
ひとこと要約

本稿では、深層畳み込みニューラルネットワークを用いた顔認識なしのヘッドポーズ推定のためのハイブリッド粗・微分類フレームワークを提案する。厳密な微分類により粗いビンからの量子化誤差が低減され、統合回帰により精度が向上する。BIWIおよびAFLW2000で最先端の性能を達成し、AFLW2000では平均絶対誤差(MAE)5.395°、BIWIでは3.017°を達成した。

ABSTRACT

Head pose estimation, which computes the intrinsic Euler angles (yaw, pitch, roll) from the human, is crucial for gaze estimation, face alignment, and 3D reconstruction. Traditional approaches heavily relies on the accuracy of facial landmarks. It limits their performances, especially when the visibility of the face is not in good condition. In this paper, to do the estimation without facial landmarks, we combine the coarse and fine regression output together for a deep network. Utilizing more quantization units for the angles, a fine classifier is trained with the help of other auxiliary coarse units. Integrating regression is adopted to get the final prediction. The proposed approach is evaluated on three challenging benchmarks. It achieves the state-of-the-art on AFLW2000, BIWI and performs favorably on AFLW. The code has been released on Github.

研究の動機と目的

  • 顔認識に依存するヘッドポーズ推定の限界を解消する。特に、顔認識検出が失敗する可能性のある視認性が低い状況での問題を解決する。
  • 顔認識なしの従来手法がマルチロス学習に依存する粗いビン分類によって生じる量子化誤差を克服する。
  • 階層的分類スキームを導入することで、微細なビンに対する stricter 制約を課すことにより、回帰ベースのヘッドポーズ推定の精度を向上させる。
  • 2次元顔認識点に依存せず、ベンチマークデータセットで最先端の性能を達成し、実世界の状況でも耐障害性を高める。

提案手法

  • ヨー、ピッチ、ロール角度のための複数の分類ヘッドを並列に学習するハイブリッド粗・微分類フレームワークを提案する。粗分類(198, 66, 18, 6, 2クラス)と微分類(198クラス)を用いる。
  • 特徴抽出に共有されたResNet-50バックボーンを用い、各角度ごとに別々の全結合ブランチを設け、マルチレベル分類ヘッドを実装する。
  • 回帰損失(L1)と分類交差エントロピー損失を組み合わせたマルチタスク損失を適用し、粗分類と微分類、回帰部のバランスをとるために適応的重み付けを行う。
  • 最終予測を、微分類ヘッドと回帰ヘッドの出力を統合することで得る。微分類の高分解能出力を活用して回帰結果を精緻化する。
  • Adam最適化法を用い、初期学習率を固定の1e-6、ImageNet正規化を適用してネットワークを学習する。±99°を超える角度を持つ画像は破棄する。
  • 損失重み係数(α, β₁, β₂, β₃, β₄, β₅)を異なる分類および回帰部に最適化するためのアブレーションスタディを実施する。

実験結果

リサーチクエスチョン

  • RQ1顔認識なしのヘッドポーズ推定において、ハイブリッド粗・微分類フレームワークは単一段階分類と比較して量子化誤差を低減できるか?
  • RQ2微細な分類に stricter 制約を課すことで、回帰ベースのヘッドポーズ推定の精度が向上するか?
  • RQ3本手法は、BIWI、AFLW2000、AFLWといった標準ベンチマークにおいて、最先端の顔認識ありおよび顔認識なし手法と比較してどのように性能を発揮するか?
  • RQ4マルチタスク学習スキームにおいて、粗分類、微分類、回帰をバランスさせる最適な損失重み設定は何か?
  • RQ5ハイブリッド分類フレームワークは、離散的量子化を伴う他の回帰タスクへも一般化可能か?

主な発見

  • 提案手法はAFLW2000データセットで平均絶対誤差(MAE)5.395°を達成し、Ruizら[1]の6.155°MAEを上回る最先端の性能を示した。
  • BIWIデータセットではMAEが3.017°に達し、ベースライン手法[1](4.895°)を著しく上回り、顔認識あり手法であるCNN + Heatmap(3.23°)でさえも上回った。
  • AFLWデータセットではMAEが5.090°を記録し、最高水準の顔認識なしおよび顔認識あり手法と同等の強力な性能を示した。
  • アブレーションスタディの結果、最適な損失重みはα=2、β₁=7、β₂=5、β₃=3、β₄=1、β₅=1であり、AFLW2000でのMAEが5.3953に最低に低下した。
  • 制御環境(BIWI)および屋外環境(AFLW2000)の両方で、本手法は耐障害性を示し、ハイブリッド分類設計の有効性を裏付けた。
  • 198クラスの微細分類ヘッドは、粗いビンと比較して顕著に誤差を低減した。これは、回帰の前に分類の精度を高める設計選択の妥当性を検証した。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。