Skip to main content
QUICK REVIEW

[論文レビュー] Multilinear Wavelets: A Statistical Shape Space for Human Faces

Alan Brunton, Timo Bolkart|arXiv (Cornell University)|Jan 13, 2014
Face recognition and analysis参考文献 13被引用数 7
ひとこと要約

本論文は、3次元人間顔面の形状をウェーブレット変換で分解することで、局所的かつ非相関的な多次元係数解析を可能にする、マルチライニア波形に基づく統計的形状モデルを提案する。この手法は、ノイズ多発、遮蔽、不完全なスキャンに対しても、詳細の保持、速度、汚染への耐性という点で、グローバルおよび局所的PCAモデルを上回る、頑健で高精細の再構成を実現し、計算効率を維持する。

ABSTRACT

We present a statistical model for $3$D human faces in varying expression, which decomposes the surface of the face using a wavelet transform, and learns many localized, decorrelated multilinear models on the resulting coefficients. Using this model we are able to reconstruct faces from noisy and occluded $3$D face scans, and facial motion sequences. Accurate reconstruction of face shape is important for applications such as tele-presence and gaming. The localized and multi-scale nature of our model allows for recovery of fine-scale detail while retaining robustness to severe noise and occlusion, and is computationally efficient and scalable. We validate these properties experimentally on challenging data in the form of static scans and motion sequences. We show that in comparison to a global multilinear model, our model better preserves fine detail and is computationally faster, while in comparison to a localized PCA model, our model better handles variation in expression, is faster, and allows us to fix identity parameters for a given subject.

研究の動機と目的

  • ノイズや遮蔽に強く、微細な幾何的詳細を捉えることができる3次元人間顔面の統計的形状モデルの開発。
  • グローバルな多次元モデルや局所的PCAモデルの、表現変動およびデータ汚染への対処の限界を解消すること。
  • 多様なソースからの不完全または汚染されたスキャンに対し、効率的でスケーラブルかつ頑健な3次元顔面形状のフィッティングを可能にすること。
  • 手動によるセグメンテーションやパーツベースのラベル付けを必要とせず、良好な一般化性能を発揮するモデルの構築。
  • 計算効率を高めることで、リアルタイムの応用(例:顔のモーショントラッキング、テレプレゼンス)を支援すること。

提案手法

  • 3次元顔面表面幾何を複数スケールにわたる局所的かつ非相関的な係数に分解するために、ウェーブレット変換を適用する。
  • 各ウェーブレット係数サブバンドに対して独立して多次元モデルを学習し、形状変動の低次元かつ非相関的なモデリングを実現する。
  • 多次元解析を用いて、個人の識別子と表現を分離し、被験者ごとに固定された識別子パラメータを実現する。
  • パラメータにきびしい統計的境界を課す最適化によりフィッティングを実施し、汚染された入力データに対しても頑健性を向上させる。
  • フレーム単位で表現重みを最適化することで、3次元モーショングレースにアルゴリズムを拡張し、自動トラッキングを可能にする。
  • 明示的なセグメンテーションを回避し、テクスチャや他のモodalitiesへの拡張も可能にする。

実験結果

リサーチクエスチョン

  • RQ1ウェーブレットベースの分解は、重度のデータ汚染下でも3次元顔面形状モデルの頑健性と詳細保持性を向上させるか?
  • RQ2ウェーブレット係数上での局所的多次元モデリングは、グローバル多次元モデルや局所的PCAモデルと比較して、フィッティング精度および計算効率に優れているか?
  • RQ3ノイズや遮蔽下でも、鼻や口の形状といった微細な顔面特徴をどの程度正確に保持できるか?
  • RQ4高精細な忠実度で、動的顔面モーショングレースを効率的にトラッキングできるか?
  • RQ5非相関的かつ低次元のサブモデルを用いることで、高次元グローバルモデルと比較して過学習が抑えられ、一般化性能が向上するか?

主な発見

  • 本モデルは、特に表現変動の際、グローバル多次元モデルや局所的PCAモデルよりも、微細な顔面特徴(例:鼻や口の形状)をより正確に再構成する。
  • Bosphorusデータセットにおける遮蔽状態でも、本モデルはグローバル多次元モデルおよび局所的PCAモデルよりも、露出領域の累積誤差が低かった。
  • 単一スレッドCPUを用いた1枚の3次元スキャンへのフィッティングは数秒で完了し、数千枚の顔面データに対する学習も数分で完了する。
  • 低次元ウェーブレット係数モデルに統計的境界を適用することで、ノイズや遮蔽に強く、過学習のリスクを低減する。
  • フィッティングアルゴリズムをモーショングレースに単純に拡張することで、高精細で安定した自動3次元顔面トラッキングが可能となり、BU4DFEシーケンスで検証された。
  • 滑らかさエネルギー正則化により、グリッドアーチファクトを回避し、非対称性(例:恐怖表現時の眉領域)の保持も優れている。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。