[論文レビュー] CenterFace: Joint Face Detection and Alignment Using Face as Point
CenterFaceは、顔の1点表現を用いて、1段階で顔検出とキーポイントアラインメントを同時に行うアンカーフリーな1ステージ手法を提案する。顔の存在、バウンディングボックス、オフセット、5つの顔面特徴点を1つのセマンティックヒートマップから予測することで、NVIDIA 2080Tiで200 FPSのリアルタイム推論を実現し、WIDER FACE(Easy/Testで0.935/0.932)およびFDDB(不連続顔で0.980)で最先端の精度を達成する。
Face detection and alignment in unconstrained environment is always deployed on edge devices which have limited memory storage and low computing power. This paper proposes a one-stage method named CenterFace to simultaneously predict facial box and landmark location with real-time speed and high accuracy. The proposed method also belongs to the anchor free category. This is achieved by: (a) learning face existing possibility by the semantic maps, (b) learning bounding box, offsets and five landmarks for each position that potentially contains a face. Specifically, the method can run in real-time on a single CPU core and 200 FPS using NVIDIA 2080TI for VGA-resolution images, and can simultaneously achieve superior accuracy (WIDER FACE Val/Test-Easy: 0.935/0.932, Medium: 0.924/0.921, Hard: 0.875/0.873 and FDDB discontinuous: 0.980, continuous: 0.732). A demo of CenterFace can be available at https://github.com/Star-Clouds/CenterFace.
研究の動機と目的
- リソース制約のあるエッジデバイス上で、制約のない環境における正確な顔検出とアラインメントを実装する課題に対処すること。
- アンカーベース手法の限界を克服し、より効率的かつ正確なアンカーフリーな代替手法を提案すること。
- 1回の順伝播で顔のバウンディングボックスと5つの顔面キーポイント位置を同時に予測すること。
- WIDER FACE や FDDB のベンチマークデータセットで高い精度を維持しながら、リアルタイム推論速度を達成すること。
- 最小限のメモリおよび計算オーバーヘッドで、CPUオンリーや低消費電力のエッジデバイスへのデプロイを可能にすること。
提案手法
- 各顔を特徴マップ上の1つのキーポイント(中心点)として表現することで、アンカーベース手法と比較して複雑性を低減する。
- 各空間的位置における顔の存在確率を、顔が存在する可能性をエンコードするセマンティックヒートマップを用いて予測する。
- 中心点から直接、バウンディングボックスのオフセットと5つの顔面特徴点座標を回帰ヘッドを用いて予測する。
- 1段階検出器アーキテクチャを用いて、1回の順伝播で顔の位置と特徴点を同時に回帰する。
- マルチスケールの顔を処理し、検出のロバスト性を向上させるために、特徴マップピラミッドネットワークを活用する。
- 分類、ボックス回帰、キーポイント回帰の損失関数を組み合わせた総合損失関数を用いて、エンドツーエンドでモデルを訓練する。
実験結果
リサーチクエスチョン
- RQ11段階でアンカーフリーな手法が、顔検出とアラインメントにおいて高い精度を達成すると同時に、リアルタイム推論速度を維持できるか?
- RQ2顔を1点表現(中心点)で表すアプローチが、検出とアラインメントのタスクをどれほど簡素化できるか?
- RQ3提案手法が、標準ベンチマークで既存のアンカーベースおよびアンカーフリー顔検出器をどの程度上回るか?
- RQ4CPUオンリーや低消費電力のエッジデバイスでも、高精度を維持しながら効率的に動作できるか?
- RQ5バウンディングボックスと顔面キーポイントの共同予測は、分離された検出とアラインメントパイプラインと比較して、どの程度優れているか?
主な発見
- CenterFaceは、WIDER FACE Val と Test-Easy データセットでそれぞれ0.935および0.932の平均適合率を達成し、先行する最先端手法を上回った。
- より困難なWIDER FACE MediumおよびHardデータセットでは、それぞれ0.924および0.921のmAPを達成し、優れた一般化性能を示した。
- FDDBでは、不連続顔に対して0.980のmAP、連続顔に対して0.732のmAPを達成し、複雑でごみだらけの状況でも優れた性能を示した。
- VGA解像度の画像に対して、1台のNVIDIA 2080Ti GPUで200 FPSで実行され、リアルタイム推論を可能にした。
- 1つのCPUコアでもリアルタイム性能を達成し、エッジデプロイに適した性能を示した。
- アンカーフリー設計により、トレーニングと推論が簡素化されながらも高い精度を維持しており、中心点表現の有効性が裏付けられた。
より良い研究を、今すぐ始めましょう
論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。
クレジットカード登録不要
このレビューはAIが作成し、人間の編集者が確認しました。