Skip to main content
QUICK REVIEW

[論文レビュー] Multi-channel Deep 3D Face Recognition

Zhiqian You, Tingting Yang|arXiv (Cornell University)|Sep 30, 2020
Face recognition and analysis参考文献 24被引用数 5
ひとこと要約

本論文では、3次元顔データを2次元平面に投影する際の幾何的忠実度を保つために共形写像を活用する、マルチチャネル深層3次元顔認識ネットワークを提案する。3次元三角形メッシュから9つの幾何的および色チャネルを計算し、それを変更された畳み込みニューラルネットワーク(CNN)に供給することで、98.6%の認識精度を達成し、垂直投影に基づくベースラインを著しく上回った。

ABSTRACT

Face recognition has been of great importance in many applications as a biometric for its throughput, convenience, and non-invasiveness. Recent advancements in deep Convolutional Neural Network (CNN) architectures have boosted significantly the performance of face recognition based on two-dimensional (2D) facial texture images and outperformed the previous state of the art using conventional methods. However, the accuracy of 2D face recognition is still challenged by the change of pose, illumination, make-up, and expression. On the other hand, the geometric information contained in three-dimensional (3D) face data has the potential to overcome the fundamental limitations of 2D face data. We propose a multi-Channel deep 3D face network for face recognition based on 3D face data. We compute the geometric information of a 3D face based on its piecewise-linear triangular mesh structure and then conformally flatten geometric information along with the color from 3D to 2D plane to leverage the state-of-the-art deep CNN architectures. We modify the input layer of the network to take images with nine channels instead of three only such that more geometric information can be explicitly fed to it. We pre-train the network using images from the VGG-Face \cite{Parkhi2015} and then fine-tune it with the generated multi-channel face images. The face recognition accuracy of the multi-Channel deep 3D face network has achieved 98.6. The experimental results also clearly show that the network performs much better when a 9-channel image is flattened to plane based on the conformal map compared with the orthographic projection.

研究の動機と目的

  • ポーズ、照明、表情の変化に対して2次元顔認識の限界を克服するため、3次元幾何的データを活用すること。
  • 従来の3次元から2次元への投影(例:垂直投影)で生じる歪みを克服し、幾何的忠実度を向上させること。
  • 色や深度に加えて、より豊かな幾何的特徴を組み込むことで、深層CNNの性能を向上させること。
  • 既存の2次元CNNアーキテクチャに効果的にマルチチャネル3次元幾何情報統合する手法を開発すること。
  • 共形写像が標準的な投影と比較して、局所的な形状と角度をよりよく保存できることを示し、認識精度の向上に寄与すること。

提案手法

  • 幾何的解析のため、3次元顔の点群を区分的線形三角形メッシュに変換する。
  • 離散的表面リッチィフローを用いて、メッシュから9つの幾何的特徴(例:曲率、法線ベクトル、共形要因)を計算する。
  • 角度と局所的形状を保存する共形写像を適用し、3次元の幾何的および色データを2次元平面に平坦化する。
  • 色と計算された幾何的特徴を組み合わせた9チャネル画像を作成し、深層CNNへの入力とする。
  • 事前学習済みのVGG-Faceネットワークの入力層を変更し、3つの代わりに9チャネル入力を許容するようにする。
  • VGG-Faceデータで事前学習した後、生成されたマルチチャネル3次元顔画像でネットワークを微調整する。

実験結果

リサーチクエスチョン

  • RQ1共形写像は、3次元顔の幾何的特徴を2次元に平坦化する際、垂直投影と比較してより正確に保持できるか?
  • RQ2色と幾何的データの9チャネルを深層CNNに組み込むことで、単一または3チャネル入力と比較して顔認識精度が向上するか?
  • RQ3さまざまな条件下で、マルチチャネル3次元顔認識ネットワークの性能は、最先端の2次元および3次元CNN手法と比べてどうか?
  • RQ4共形写像による幾何的忠実度の向上は、ポーズや表情の変化に起因する認識誤りをどの程度低減するか?
  • RQ5限られたラベル付き3次元顔データが、マルチチャネル3次元顔認識ネットワークの性能に与える影響は何か?

主な発見

  • マルチチャネル深層3次元顔ネットワークは、BosphorusおよびTexasFRDデータセットでランク1認識精度98.6%を達成した。
  • 垂直投影に基づく9チャネル手法(95.6%精度)と比較して、本手法は優位であることが示され、共形写像の優位性を裏付けた。
  • 共形写像は局所的な幾何的構造と角度を保存し、垂直投影と比較して歪みを低減した。
  • 従来の3次元顔認識手法およびFaceNetのような2次元顔認識モデルと比較して、本手法は顔認識性能を著しく向上させた。
  • 限られた学習データでも、共形マップを用いた場合、垂直投影よりも顔認識性能が顕著に優れていた。
  • 限られた学習データにもかかわらず、マルチチャネル3次元顔認識手法において最先端の性能を達成しており、幾何的特徴符号化の有効性を示した。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。