[論文レビュー] KEPLER: Keypoint and Pose Estimation of Unconstrained Faces by Learning Efficient H-CNN Regressors
KEPLERは、顔のキーポイント位置および3次元ポーズ(ピッチ、ヨー、ロール)を非制約的顔画像で推定するために、新規のチャネル化されたインセプションH-CNNアーキテクチャを用いた反復的かつ段階的な回帰フレームワークを提案する。5回の反復において可視性、特徴点、3次元ポーズを同時に回帰することで、AFLWおよびAFWデータセットで最先端の性能を達成し、AFLW-Allvariantsでは平均誤差2.35px、3次元ポーズ推定では平均6.45°の誤差を達成した。
Keypoint detection is one of the most important pre-processing steps in tasks such as face modeling, recognition and verification. In this paper, we present an iterative method for Keypoint Estimation and Pose prediction of unconstrained faces by Learning Efficient H-CNN Regressors (KEPLER) for addressing the face alignment problem. Recent state of the art methods have shown improvements in face keypoint detection by employing Convolution Neural Networks (CNNs). Although a simple feed forward neural network can learn the mapping between input and output spaces, it cannot learn the inherent structural dependencies. We present a novel architecture called H-CNN (Heatmap-CNN) which captures structured global and local features and thus favors accurate keypoint detecion. HCNN is jointly trained on the visibility, fiducials and 3D-pose of the face. As the iterations proceed, the error decreases making the gradients small and thus requiring efficient training of DCNNs to mitigate this. KEPLER performs global corrections in pose and fiducials for the first four iterations followed by local corrections in the subsequent stage. As a by-product, KEPLER also provides 3D pose (pitch, yaw and roll) of the face accurately. In this paper, we show that without using any 3D information, KEPLER outperforms state of the art methods for alignment on challenging datasets such as AFW and AFLW.
研究の動機と目的
- 固定されたポイントモデルが失敗する非制約的で、かつ部分的遮蔽を伴う顔画像における顔のキーポイントの正確な局所化の課題に対処する。
- 固定構造の回帰器の限界を克服し、事前の形状仮定なしに任意の顔の形状に対して段階的回帰を可能にする。
- キーポイント推定パイプラインの副産物として、3次元顔ポーズ(ピッチ、ヨー、ロール)とキーポイントの可視性を同時に予測する。
- 誤差が減少するに従い勾配が小さくなる後続の学習段階において、各段階ごとに適応的な学習方針を導入することで、学習効率を向上させる。
- AFLWに多様なポーズと表情の変動を含めた、より現実的で挑戦的な評価プロトコルを導入する。
提案手法
- GoogLeNetのインセプションモジュールをインspiredしたが、チャネル単位での特徴融合を特徴とする、中間層からの特徴をプールおよび連結する新しいチャネル化されたインセプションH-CNNアーキテクチャを提案する。
- 各段階で全68点の特徴点に対するインクリメンタルなオフセットを予測しながら形状の一貫性を保つ、反復的かつ段階的な回帰フレームワークを設計する。
- マルチタスク損失を用いて、キーポイントの可視性信頼度、2次元特徴点座標、3次元ポーズ(ピッチ、ヨー、ロール)の3つのタスクを同時にH-CNNで学習する。
- 誤差が減少するに従い勾配が小さくなるため、特に後続段階において異なる学習方針を適用する。
- [9]にインspiredした固定ポイント統合スキームを用い、ランドマーク推定の安定性を高め、収束性を改善する。
- 最終段階で、特に非一様なアノテーションを持つAFWにおいて、ボクシングボックスの不一致を効果的に修正する。
実験結果
リサーチクエスチョン
- RQ1事前の形状制約なしに、任意の非制約的顔に段階的回帰を効果的に適応できるか?
- RQ2深層H-CNNアーキテクチャが、構造的一致性を保ちながらキーポイント位置、可視性、3次元ポーズを同時に回帰できるか?
- RQ3段階別に学習方針を設定した反復的精錬が、勾配が小さい領域での収束性と精度を向上させるか?
- RQ4ボクシングボックスアノテーションと遮蔽レベルにばらつきのある異なるデータセット間で一般化できるか?
- RQ5可視性と3次元ポーズの共同マルチタスク学習が、キーポイント局所化性能をどの程度向上させるか?
主な発見
- KEPLERはAFLW-Allvariantsプロトコルにおいて2.35pxの平均絶対誤差(MAE)を達成し、すべての先行SOTA手法を上回った。
- AFWデータセットでは3.01pxのMAEを達成し、CCLに次いで2位であり、第5段階を用いることで60%の性能向上を達成した。
- AFLWテストセットでは、ヨー方向で6.45°、ピッチ方向で5.85°、ロール方向で8.75°の3次元ポーズ推定誤差を低下させた。
- AFWデータセットでは3次元ポーズ推定の正確さが96.67%に達し、96%以上の予測が±15°の誤差許容範囲内に収束した。
- AFLWでは第5段階は任意であるが、AFWでは非一様なボクシングボックスアノテーションに対処する上で顕著な60%の性能向上を示し、その価値を実証した。
- 視覚的結果から、KEPLERがサブピクセルレベルでランドマーク位置を効果的に補正し、特に第5段階以降において遮蔽された点に対しても従来手法よりもより頑健に処理できることを確認した。
より良い研究を、今すぐ始めましょう
論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。
クレジットカード登録不要
このレビューはAIが作成し、人間の編集者が確認しました。