[論文レビュー] FP-Age: Leveraging Face Parsing Attention for Facial Age Estimation in the Wild
本稿では、制約のない環境におけるポーズや表情の変化にもかかわらず、顔の領域としての目や口といった意味的に有用な部分に焦点を当てるために顔パーツ分類アテンションを活用する、新しい顔年齢推定フレームワークFP-Ageを提案する。事前学習済み顔パーツ分類ネットワークから得られる粗いおよび詳細な特徴を、専用の顔パーツ分類アテンションモジュールを介して統合することで、FP-AgeはIMDB-Cleanおよび複数のベンチマークデータセットにおいて、内部およびクロスデータセット評価プロトコルの両方で最先端の性能を達成した。
Image-based age estimation aims to predict a person's age from facial images. It is used in a variety of real-world applications. Although end-to-end deep models have achieved impressive results for age estimation on benchmark datasets, their performance in-the-wild still leaves much room for improvement due to the challenges caused by large variations in head pose, facial expressions, and occlusions. To address this issue, we propose a simple yet effective method to explicitly incorporate facial semantics into age estimation, so that the model would learn to correctly focus on the most informative facial components from unaligned facial images regardless of head pose and non-rigid deformation. To this end, we design a face parsing-based network to learn semantic information at different scales and a novel face parsing attention module to leverage these semantic features for age estimation. To evaluate our method on in-the-wild data, we also introduce a new challenging large-scale benchmark called IMDB-Clean. This dataset is created by semi-automatically cleaning the noisy IMDB-WIKI dataset using a constrained clustering method. Through comprehensive experiment on IMDB-Clean and other benchmark datasets, under both intra-dataset and cross-dataset evaluation protocols, we show that our method consistently outperforms all existing age estimation methods and achieves a new state-of-the-art performance. To the best of our knowledge, our work presents the first attempt of leveraging face parsing attention to achieve semantic-aware age estimation, which may be inspiring to other high level facial analysis tasks. Code and data are available on \url{https://github.com/ibug-group/fpage}.
研究の動機と目的
- ポーズ、表情、遮蔽の変化によってモデルの精度が低下する、制約のない屋外環境における顔年齢推定の性能を向上させること。
- 目、鼻、口といった顔の意味的特徴を明示的に年齢推定に組み込み、より有用な領域に注目を向けるようにすること。
- IMDB-WIKIからノイズの多いサンプルを半自動的に除去することで、屋外年齢推定用のクリアで大規模なベンチマークデータセットを構築すること。
- 顔の異なる部位が年齢推定にどのように寄与するかを明らかにし、特に鼻が最も情報量が少ないことを示すこと。
- エンド・ツー・エンドで学習可能なフレームワークにおいて、意味的特徴学習とアテンションメカニズムを組み合わせることで、年齢推定の新たな最先端性能を確立すること。
提案手法
- 入力された顔画像から、事前学習済み顔パーツ分類ネットワークを用いてマルチスケールの意味的特徴を抽出し、顔領域の粗いおよび詳細な表現を提供する。
- 目や口の周辺といった、特に情報量の多い意味的特徴に動的に重み付けして注目するための、新規の顔パーツ分類アテンション(FPA)モジュールを設計する。このモジュールは、高レベル特徴と統合することで、特徴を強化する。
- 低レベルおよび高レベル特徴を、学習された顔パーツ分類マスクと連結することで、年齢予測用の統一された表現を形成する。
- FPAモジュールは、意味的特徴に適合した特徴を集約する学習可能なアテンションメカニズムを用いる。これにより、追加の分類アノテーションを必要とせず、特徴の識別能が向上する。
- FPAモジュール全体を標準の年齢推定損失関数を用いてエンド・ツー・エンドで学習させることで、分類に依存するアテンションと年齢予測の両方を同時に最適化可能となる。
- IMDB-WIKIデータセットに対して、制約付きクラスタリングに基づく半自動的なデータクリーニングパイプラインを適用し、ノイズを低減し、データ品質を向上させた新しいIMDB-Cleanベンチマークを生成した。
![Figure 1: FP-Age. A pre-trained face parsing framework [ 4 ] (top) is used to extract features of the target face in the input image. A lightweight network (bottom) aggregates low-level features, high-level features and face masks to predict the age. The shapes of tensors are labelled by the blocks](https://ar5iv.labs.arxiv.org/html/2106.11145/assets/x1.png)
実験結果
リサーチクエスチョン
- RQ1アテンションを用いて顔の意味的パーツを明示的にモデル化することで、制約のない屋外環境における年齢推定性能が向上するか?
- RQ2目、口、鼻といった異なる顔の領域は、年齢推定の精度にどのように寄与するか?特に情報量が多いのはどの領域か?
- RQ3追加のアノテーションを必要とせず、事前学習済み顔パーツ分類ネットワークを効果的に活用して年齢推定を向上させられるか?
- RQ4提案された顔パーツ分類アテンションメカニズムは、多様なデータセットおよび評価プロトコルにおいて、より頑健で正確な年齢予測をもたらすか?
- RQ5クリーニング済みの大規模ベンチマーク、たとえばIMDB-Cleanは、年齢推定においてより信頼性が高く汎用性の高い性能向上をもたらすか?
主な発見
- FP-Ageは、クロスデータセット評価においてIMDB-Cleanデータセットで平均絶対誤差(MAE)5.60という、新たな最先端性能を達成した。これは、先行手法を著しく上回った。
- FG-Netデータセットでは、MAEが6.81、CS5スコアが48.49を達成し、クロスデータセット評価においてすべての先行手法を上回った。
- 統計的有意性検定の結果、FP-Ageの性能は8つの競合手法よりも顕著に優れていた(ボンフェローニ補正済みp値はすべて1e-100未満)。
- 鼻領域は年齢推定において最も情報量が少なく、目や口の端は一貫して予測精度に重要な役割を果たしていた。
- モデルは多様なデータセットに対して頑健であることが示され、Morph、CACD、KANFace、FG-Netの各データセットにおいて、内部およびクロスデータセットプロトコルの両方で最先端性能を達成した。
- アブレーションスタディの結果、顔パーツ分類アテンションモジュールが性能を顕著に向上させることを確認し、意味的に関連する顔の部位に注目を向ける役割を裏付けた。
![Figure 2: RoI Tanh-polar Transform [ 4 ] warps the whole image to a fix-sized representation in the Tanh-polar space with the given bounding box.](https://ar5iv.labs.arxiv.org/html/2106.11145/assets/x2.png)
より良い研究を、今すぐ始めましょう
論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。
クレジットカード登録不要
このレビューはAIが作成し、人間の編集者が確認しました。