Skip to main content
QUICK REVIEW

[論文レビュー] Evaluation of Dense 3D Reconstruction from 2D Face Images in the Wild

Zhenhua Feng, Patrik Huber|View|Mar 14, 2018
Face recognition and analysis参考文献 23被引用数 10
ひとこと要約

本論文は、135名の被験者から得た2,000枚のウェルド2次元顔画像と高解像度3次元グランドトゥーススキャンを用いた、新しいベンチマークデータセットを紹介する。これにより、単一のウェルド2次元顔画像からの高密度3次元顔再構築の客観的評価が可能になる。5つの最先端手法を評価した結果、テクスチャを活用する深層学習手法がランドマークのみを用いる手法を著しく上回るが、計算負荷が高くなるという代償を伴うことが明らかになった。

ABSTRACT

This paper investigates the evaluation of dense 3D face reconstruction from a single 2D image in the wild. To this end, we organise a competition that provides a new benchmark dataset that contains 2000 2D facial images of 135 subjects as well as their 3D ground truth face scans. In contrast to previous competitions or challenges, the aim of this new benchmark dataset is to evaluate the accuracy of a 3D dense face reconstruction algorithm using real, accurate and high-resolution 3D ground truth face scans. In addition to the dataset, we provide a standard protocol as well as a Python script for the evaluation. Last, we report the results obtained by three state-of-the-art 3D face reconstruction systems on the new benchmark dataset. The competition is organised along with the 2018 13th IEEE Conference on Automatic Face & Gesture Recognition.

研究の動機と目的

  • 単一のウェルド2次元顔画像からの高密度3次元顔再構築を評価するための信頼性があり、客観的なベンチマークを確立すること。
  • 既存のデータセットに実際の高解像度3次元グランドトゥースが不足していることによる定量的評価の制限を是正すること。
  • 標準化されたプロトコルと公開されたデータを用いて、最先端の3次元再構築アルゴリズムの公平な比較を可能にすること。
  • 実世界の困難な条件下で、テクスチャとランドマークベースのフィッティングが再構築精度に与える影響を調査すること。
  • データセット、評価プロトコル、コードの公開を通じて、今後の研究を支援し、再現可能性とコミュニティ全体の採用を促進すること。

提案手法

  • 135名の被験者から得た2,000枚のウェルド2次元顔画像と対応する高解像度3次元スキャンを用いて、新しいベンチマークデータセットを構築した。
  • 正確で高解像度のグランドトゥースを確保するため、構造化光3次元スキャナを用いて3次元グランドトゥースを取得した。
  • 標準化された評価プロトコルを定義し、一貫した性能測定を可能にするPythonスクリプトを提供した。
  • 5つの最先端の3次元顔再構築システムを評価した:サリー大学の2つ(MTCNN+CNN6+eos、MTCNN+CNN6+3DDFA)、四 川大学の1つ(SCU-BRL)、および2つの深層学習ベースの手法(3DDFA、3DMM-CNN)。
  • 3D-RMSEを主な指標として単一画像再構築評価を実施し、高品質および低品質の画像サブセットについての追加分析も行った。
  • SCU-BRLを含む一部のシステムについて、複数枚の画像を活用した再構築実験を実施し、複数画像からの利点を評価した。

実験結果

リサーチクエスチョン

  • RQ1実際の高解像度3次元グランドトゥースを有するウェルド2次元画像上で、最先端の3次元顔再構築アルゴリズムはどの程度の性能を示すか?
  • RQ2ランドマークのみのフィッティングと比較して、テクスチャ情報が3次元再構築精度にどの程度寄与するか?
  • RQ3画像品質(例:極端なアングル、照明条件)が、異なる再構築手法の性能に与える影響はいかほどか?
  • RQ4複数枚の画像を用いたフィッティングは、単一画像手法と比較して顕著に再構築精度を向上させ得るか?
  • RQ5現在の3次元顔再構築パイプラインにおいて、再構築精度と計算効率のトレードオフはどのようなものか?

主な発見

  • 3DMM-CNNとMTCNN+CNN6+3DDFAの2つのシステムが、全ベンチマークデータセットで3D-RMSE 2.26±0.72および2.31±0.75を達成し、ランドマークのみの手法を上回った。
  • ランドマークのみの手法(MTCNN+CNN6+eos、MTCNN+CNN6+ESO、SCU-BRL)は、3.05±0.89から3.12±0.91の高い誤差を示し、困難な条件下での精度の限界を示した。
  • 最良のシステム(3DMM-CNN)の3D-RMSEは、複数枚の画像を用いたフィッティングにより2.26±0.72に低下し、補完的データからの顕著な改善が確認された。
  • テクスチャを活用する深層学習手法(3DDFA、3DMM-CNN)がランドマークのみの手法を上回ったことから、テクスチャが形状情報として重要な役割を果たすことが示された。
  • 3DDFAは標準CPUで約1.5fpsで動作した一方、eosは100fps以上で動作し、大きなスピード-精度のトレードオフが明らかになった。
  • 深層学習ベースのシステムでは、高品質と低品質のサブセット間の性能差が小さく、画像劣化に対して高い耐性を示した。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。