[論文レビュー] Accurate Facial Parts Localization and Deep Learning for 3D Facial Expression Recognition
本稿では、2次元テクスチャおよび深度マップからの正確な顔の部位局在を活用し、カスタム畳み込みニューラルネットワーク(CNN)サブネットによる深層特徴の統合を通じて、部位固有の重要度重みを学習する、新しい3次元顔の表情認識システムを提案する。本手法は、統合された顔の部位からのVGG-M-DF特徴を用いて、BU-3DFEデータセットで最先端の88.54%の平均認識率を達成した。
Meaningful facial parts can convey key cues for both facial action unit detection and expression prediction. Textured 3D face scan can provide both detailed 3D geometric shape and 2D texture appearance cues of the face which are beneficial for Facial Expression Recognition (FER). However, accurate facial parts extraction as well as their fusion are challenging tasks. In this paper, a novel system for 3D FER is designed based on accurate facial parts extraction and deep feature fusion of facial parts. In particular, each textured 3D face scan is firstly represented as a 2D texture map and a depth map with one-to-one dense correspondence. Then, the facial parts of both texture map and depth map are extracted using a novel 4-stage process consists of facial landmark localization, facial rotation correction, facial resizing, facial parts bounding box extraction and post-processing procedures. Finally, deep fusion Convolutional Neural Networks (CNNs) features of all facial parts are learned from both texture maps and depth maps, respectively and nonlinear SVMs are used for expression prediction. Experiments are conducted on the BU-3DFE database, demonstrating the effectiveness of combing different facial parts, texture and depth cues and reporting the state-of-the-art results in comparison with all existing methods under the same setting.
研究の動機と目的
- 顔の部位を判別的単位として活用することで、3次元顔の表情認識(FER)の性能を向上させること。
- テクスチャと深度マップ間の密な対応関係を用いて、テクスチャ付き3次元顔スキャンから正確な顔の部位抽出に挑戦すること。
- 深層統合CNNサブネットを通じて、異なる顔の部位からの特徴の重要度と組み合わせ方を学習すること。
- 個々の顔の部位レベルで2次元テクスチャと3次元幾何的特徴を統合することで、最先端の性能を達成すること。
- 3次元FERにおける部位ベース表現が全体顔表現よりも優れていることを実証すること。
提案手法
- 各3次元顔スキャンは、1対1の密な対応関係を持つ2次元テクスチャマップと深度マップに分解される。
- 4段階の顔の部位局在パイプラインが適用される:顔の特徴点局在、回転補正、リサイズ、および後処理を施したバウンディングボックス抽出。
- 事前学習済みのVGG-M-DFネットワークが、各顔の部位のテクスチャおよび深度マップから深層特徴を抽出する。
- 新規の深層統合サブネットが、部位固有の重要度重みを学習し、非線形的に特徴を統合して表情予測を行う。
- 最終的な統合特徴は、非線形SVMを用いて6つの基本表情に分類される。
- 本システムは、BU-3DFEデータセット上で標準的な10分割交差検証プロトコルに従って訓練および評価される。
実験結果
リサーチクエスチョン
- RQ13次元顔スキャンからの顔の部位の正確な局在化は、顔の表情認識性能を向上させることができるか?
- RQ2個々の顔の部位からのテクスチャおよび深度の特徴は、表情認識にどのように寄与するか?また、それらは効果的に統合可能か?
- RQ3深層統合サブネットを用いて部位固有の重要度重みを学習することで、全体顔または手作業による特徴統合と比較して認識精度が向上するか?
- RQ4顔の部位(例:口、目、眉)のそれぞれが3次元データにおける表情認識に果たす相対的寄与度は何か?
- RQ5本手法は、先行研究と同一の評価プロトコル下でBU-3DFEベンチマークで最先端の性能を達成するか?
主な発見
- 本手法は、顔の部位からのVGG-M-DF特徴を用いて、BU-3DFEデータセットで最先端の平均認識率88.54%を達成した。
- 顔の部位からのテクスチャと深度特徴を統合すると、全体顔特徴統合(85.58%対88.54%)と比較して3.04%の向上が得られた。
- 口は最も表現力のある顔の部位であり、テクスチャおよび深度の両方の特徴を用いることで81.94%の精度を達成した。
- 手作業による特徴と比較して、深層統合サブネットは顕著な性能向上をもたらし、最高の手作業手法(ULBP:86.89%)と比較して2.95%の向上を示した。
- 全顔ではなく部位を用いることで、あらゆる特徴タイプにおいて認識精度が向上し、部位ベース表現の有効性が実証された。
- 2次元および3次元の特徴統合は一貫して性能向上をもたらし、テクスチャ特徴は単独で深度特徴を上回ったが、両者の組み合わせが最も高い向上をもたらした。
より良い研究を、今すぐ始めましょう
論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。
クレジットカード登録不要
このレビューはAIが作成し、人間の編集者が確認しました。