[論文レビュー] Self-supervised Multi-level Face Model Learning for Monocular Reconstruction at over 250 Hz
本稿では、3次元可塑モデル(3DMM)と学習可能な補正空間、および微分可能レンダラを組み合わせることで、従来の3DMMの低次元部分空間を超える一般化性を持つ自己教師あり、エンドツーエンドで学習可能な単眼3次元顔再構成手法を提案する。本手法は、幾何学的形状、反射率(顔のひげを含む)、照明の高精細再構成を250 Hz以上で達成する。自己教師学習によるマルチレベル自己教師損失を用いることで、密集したアノテーションなしに学習が可能であり、従来の3DMMの制限された部分空間を超える一般化性を実現する。
The reconstruction of dense 3D models of face geometry and appearance from a single image is highly challenging and ill-posed. To constrain the problem, many approaches rely on strong priors, such as parametric face models learned from limited 3D scan data. However, prior models restrict generalization of the true diversity in facial geometry, skin reflectance and illumination. To alleviate this problem, we present the first approach that jointly learns 1) a regressor for face shape, expression, reflectance and illumination on the basis of 2) a concurrently learned parametric face model. Our multi-level face model combines the advantage of 3D Morphable Models for regularization with the out-of-space generalization of a learned corrective space. We train end-to-end on in-the-wild images without dense annotations by fusing a convolutional encoder with a differentiable expert-designed renderer and a self-supervised training loss, both defined at multiple detail levels. Our approach compares favorably to the state-of-the-art in terms of reconstruction quality, better generalizes to real world faces, and runs at over 250 Hz.
研究の動機と目的
- 従来の3DMMの低次元部分空間を超えるより一般化性の高い顔モデルを学習することで、単眼3次元顔再構成の不適切な定式化を解消すること。
- 単一のRGB画像から詳細な顔の幾何学的形状、反射率、照明を250 Hzを超える高速でリアルタイムに再構成すること。
- 密集した真値アノテーションなしに、野生の画像上でエンドツーエンドで学習可能である自己教師学習を活用して、顔のひげ、化粧、複雑な反射率を含む多様な現実世界の顔への一般化を可能にすること。
- 3DMMの正則化と学習可能な補正空間を組み合わせることで、顔のひげ、複雑な反射率を含む現実世界の顔の多様性への一般化を向上させること。
提案手法
- 本手法は、CNNエンコーダと微分可能で専門家が設計したレンダラを備えたハイブリッド畳み込みオートエンコーダを採用し、複数の詳細レベルでの画像形成をモデル化する。
- 3DMMの正則化と学習可能な補正空間を組み合わせたマルチレベル顔モデルを学習し、元の3DMM部分空間を超えて一般化する。
- フォトメトリック、輪郭、形状/反射率正則化子を含む、複数の詳細レベルで動作する自己教師損失を用いてネットワークを学習する。
- 主な構成要素には、顔のアライメントを向上させるための輪郭制約、形状安定化項、および反射率のスパarsity事前分布(局所的およびグローバル)が含まれ、影の付与が反射率に誤って割り当てられるのを防ぐ。
- 訓練の安定性を維持し、フォトメトリック再レンダリング誤差を低減するために、回帰器に線形(アフィン)マッピングを用いる。
- 訓練プロセスは2段階スケジュールを採用する:まず3DMMの事前学習を行い、その後、CNNエンコーダとレンダラと3DMMおよび補正空間を同時に微調整する。
実験結果
リサーチクエスチョン
- RQ1自己教師ありでエンドツーエンドで学習可能なフレームワークは、単眼3次元顔再構成のためのより一般化性の高い顔モデルと深層回帰器を同時に学習可能か?
- RQ23DMMの正則化と学習可能な補正空間を組み合わせたマルチレベル顔モデルは、顔のひげや複雑な反射率を含む現実世界の顔の多様性への一般化をどの程度向上できるか?
- RQ3微分可能なレンダラとマルチレベル自己教師損失は、密集したアノテーションなしに高精細な再構成をどの程度可能にするか?
- RQ4形状および反射率の正則化子(例:スパarsity、滑らかさ)は、再構成品質および安定性にどのような影響を及えるか?
主な発見
- 本手法は250 Hzを超える推論速度を達成し、リアルタイムな単眼3次元顔再構成を実現する。
- 形状および反射率の補正パラメータが500個のネットワークは、ベースラインの3DMMオンリーモデル(C = 0)を上回り、フォトメトリック再レンダリング誤差が最小となる。
- 反射率のスパarsity事前分布を除去すると、影が反射率に誤って割り当てられるようになるため、正確な表面外観推定にはこれらの事前分布が必要であることが示された。
- 形状正則化項(安定化および滑らかさ)は極めて重要であり、それらを除去すると補正変位の過剰な自由度が生じ、訓練が失敗する。
- 合成テストデータでは、反射率推定のピクセル単位のRGB誤差が0.072に達し、反射率推定の高精度を示している。
- 顔のひげや化粧を含む挑戦的な現実世界のケースに対しても、本手法は頑健に一般化し、最新の最適化ベースおよび学習ベースの手法を再構成品質および頑健性の面で上回っている。
より良い研究を、今すぐ始めましょう
論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。
クレジットカード登録不要
このレビューはAIが作成し、人間の編集者が確認しました。