Skip to main content
QUICK REVIEW

[論文レビュー] Deep and Shallow Covariance Feature Quantization for 3D Facial Expression Recognition

Walid Hariri, Nadir Farah|arXiv (Cornell University)|May 12, 2021
Face and Expression Recognition参考文献 54被引用数 4
ひとこと要約

本稿では、3次元顔スキャンおよびその2次元投影から抽出された深層および浅層特徴からの共分散特徴量子化を用いた、新しい3次元顔の表情認識手法を提案する。深層特徴には畳み込みニューラルネットワーク(CNN)を、浅層特徴には幾何的記述子を適用し、共分散行列学習の後、Bag-of-Features(BoF)量子化を適用することで、BU-3DFEおよびBosphorusデータセットで最先端の精度を達成した。特に、統合コードブックを用いた場合、Bosphorusデータセットでの認識率は93.30%に達した。

ABSTRACT

Facial expressions recognition (FER) of 3D face scans has received a significant amount of attention in recent years. Most of the facial expression recognition methods have been proposed using mainly 2D images. These methods suffer from several issues like illumination changes and pose variations. Moreover, 2D mapping from 3D images may lack some geometric and topological characteristics of the face. Hence, to overcome this problem, a multi-modal 2D + 3D feature-based method is proposed. We extract shallow features from the 3D images, and deep features using Convolutional Neural Networks (CNN) from the transformed 2D images. Combining these features into a compact representation uses covariance matrices as descriptors for both features instead of single-handedly descriptors. A covariance matrix learning is used as a manifold layer to reduce the deep covariance matrices size and enhance their discrimination power while preserving their manifold structure. We then use the Bag-of-Features (BoF) paradigm to quantize the covariance matrices after flattening. Accordingly, we obtained two codebooks using shallow and deep features. The global codebook is then used to feed an SVM classifier. High classification performances have been achieved on the BU-3DFE and Bosphorus datasets compared to the state-of-the-art methods.

研究の動機と目的

  • 照明やポーズの変化に敏感な2次元ベースの表情認識の限界を、3次元幾何データを活用することで解消すること。
  • 畳み込みニューラルネットワーク(CNN)からの深層特徴と、3次元スキャンからの浅層幾何特徴を統合することで、3次元FERにおける特徴表現を向上させること。
  • 共分散行列学習を用いて特徴記述子の判別力と多様体構造を強化すること。
  • Bag-of-Features(BoF)パラダイムを用いて深層および浅層共分散行列を量子化することで、頑健な分類を実現すること。
  • マルチモodalな2D+3D特徴統合戦略を用いて、ベンチマーク用3次元顔の表情認識データセットにおいて、既存の最先端手法を上回ること。

提案手法

  • 曲率や法線成分などの幾何的記述子を用いて、3次元顔スキャンから直接浅層特徴を抽出する。
  • 3次元スキャンから得られる深度マップや法線マップなどの2次元投影に、事前学習済みのCNN(VGG-16およびAlexNet)を適用して深層特徴を生成する。
  • 浅層および深層特徴を共分散行列として表現することで、統計的関係を捉え、リーマン多様体構造を保持する。
  • 深層共分散行列学習を適用し、次元削減を図り、判別力を向上させるとともに、共分散記述子の多様体特性を維持する。
  • 学習済みの深層および浅層共分散行列を平坦化し、それぞれのモodalに対して独立したコードブックを構築するためにBag-of-Features(BoF)パラダイムを適用する。
  • 深層および浅層コードブックを統合してグローバル特徴ベクトルを生成し、多クラスSVMを用いて表情を分類する。

実験結果

リサーチクエスチョン

  • RQ12次元および3次元モダリティからの深層および浅層特徴を統合することで、3次元顔の表情認識性能が向上するか?
  • RQ2特徴の共分散行列表現が、3次元FERにおける幾何的構造を保持しつつ、判別力を向上させるか?
  • RQ3深層共分散行列学習が、判別力を損なわず、次元削減と特徴のコンパクト化を効果的に行えるか?
  • RQ4共分散行列のBoFベースの量子化が、単一モダリティまたは非量子化アプローチよりも優れた分類性能をもたらすか?
  • RQ5本手法は、標準ベンチマークにおいて、既存の最先端3次元FER手法と比較して、精度および頑健性の面で優れているか?

主な発見

  • 提案手法はBosphorusデータセットで93.30%の分類精度を達成し、Ramyaらの最先端手法(87.69%)を上回った。
  • 深層コードブック単体が浅層コードブックよりも高い精度を示し、深層特徴の優れた判別力が裏付けられた。
  • 深層および浅層コードブックの統合は、深層コードブック単体よりも優れた性能を示し、マルチモーダル特徴統合の補完的利点を実証した。
  • 共分散行列学習は、深層共分散行列のサイズを効果的に削減するとともに、判別力を向上させ、リーマン多様体構造を保持した。
  • BoFパラダイムは共分散記述子の量子化に効果的であり、SVMのような従来の分類器を3次元FERで効率的に利用可能にした。
  • 本手法はBU-3DFEおよびBosphorusデータセットの両方で優れた一般化性能と頑健性を示し、3次元顔の表情認識における有効性を確認した。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。