Skip to main content
QUICK REVIEW

[論文レビュー] RankPose: Learning Generalised Feature with Rank Supervision for Head Pose Estimation

Donggen Dai, Wangkit Wong|arXiv (Cornell University)|May 22, 2020
Face recognition and analysis参考文献 26被引用数 7
ひとこと要約

RankPose は、コサインおよびアークコサイン変換を用いて有界な角度空間にポーズ予測を再定式化し、同一人物の画像ペアに対して順序付け損失を導入したシアンズネットワークを採用することで、識別子や照明に依存しない一般化されたポーズ固有の特徴を学習する、RGBに基づく頭部ポーズ推定のための新しい深層学習アプローチを提案する。本手法は最先端の性能を達成し、AFLW2000ではMAEを3.66に低下、BIWIでは3.71に低下させ、それぞれ前回SOTAより18.66%および7.25%の改善を達成した。

ABSTRACT

We address the challenging problem of RGB image-based head pose estimation. We first reformulate head pose representation learning to constrain it to a bounded space. Head pose represented as vector projection or vector angles shows helpful to improving performance. Further, a ranking loss combined with MSE regression loss is proposed. The ranking loss supervises a neural network with paired samples of the same person and penalises incorrect ordering of pose prediction. Analysis on this new loss function suggests it contributes to a better local feature extractor, where features are generalised to Abstract Landmarks which are pose-related features instead of pose-irrelevant information such as identity, age, and lighting. Extensive experiments show that our method significantly outperforms the current state-of-the-art schemes on public datasets: AFLW2000 and BIWI. Our model achieves significant improvements over previous SOTA MAE on AFLW2000 and BIWI from 4.50 to 3.66 and from 4.0 to 3.71 respectively. Source code will be made available at: https://github.com/seathiefwang/RankHeadPose.

研究の動機と目的

  • 顔の識別子、照明、表情の変動に起因する性能制限に起因する2D RGB画像における頭部ポーズ推定の課題に対処すること。
  • 識別子や照明といったポーズに無関係な要因に依存しない、ポーズに関連する特徴を学習することで、特徴の一般化を向上させること。
  • 同一人物の画像ペアにおけるポーズ予測の相対的順序が正しく保たれるように制約を課すことで、局所的特徴の学習を強化する損失関数の開発。
  • 幾何的変換と順序ベースの監視を組み合わせることで、公開ベンチマークで最先端の性能を達成すること。

提案手法

  • 深層特徴および出力重みにL2正規化を適用し、コサイン類似度に基づく角度推定に変換することで、ポーズ予測を有界な角度空間に再定式化する。
  • 同一人物の画像ペアを処理するためのシアンズネットワークアーキテクチャを用い、類似したグローバルな条件下でのポーズ予測の比較を可能にする。
  • 同一人物の画像ペア間の予測角度の順序が正しくない場合にペナルティを与える順序損失を導入し、モデルがポーズ関連の特徴を優先的に学習するように促進する。
  • 順序損失とMSE回帰損失を組み合わせ、精度と相対的ポーズ順序の両方を同時に最適化する。
  • コサイン類似度の出力を実際のオイラー角にマッピングするためにアークコサイン変換を適用し、有界で幾何学的に意味のある予測を保証する。
  • 対照的監視を通じて、識別子や照明に依存しないポーズ固有の特徴(抽象的なランドマーク)をエンドツーエンドで学習する。

実験結果

リサーチクエスチョン

  • RQ1コサインおよびアークコサイン演算を用いて頭部ポーズ予測を有界な角度空間に変換することで、回帰精度が向上するか?
  • RQ2同一人物の画像ペアを比較する順序損失は、照明や識別子といったポーズに無関係な変動に対するモデルの一般化能力を向上させるか?
  • RQ3アークコサイン変換と順序損失の組み合わせにより、ポーズ推定における局所的特徴の学習が向上するか?
  • RQ4提案手法は、AFLW2000 や BIWI といった標準ベンチマークで、既存の最先端手法をどの程度上回るか?

主な発見

  • RankPose は AFLW2000 における平均 MAE を SOTA の 4.50 から 3.66 に低下させ、18.66% の改善を達成した。
  • BIWI データセットでは、MAE を SOTA の 4.00 から 3.71 に改善し、相対的に 7.25% 減少させた。
  • 誤差分布の結果、ヨー予測の98.7%が15°以内、ピッチの97.25%が20°以内、ロールの97.15%が20°以内に収まっており、強力なロバスト性を示している。
  • アブレーションスタディの結果、MSE に加えて順序損失を適用した場合が、MSE 単体よりも一貫して優れた性能を示し、アークコサイン変換が最良の性能を達成した。
  • ヨー、ピッチ、ロールのすべての角度で優れた性能を発揮し、ランドマークベースおよびランドマークフリーの両方のSOTA手法を一貫して上回った。
  • 本手法は優れた一般化性能を示しており、特に識別子や照明が変動する困難な条件下でも顕著な優位性を示した。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。