Skip to main content
QUICK REVIEW

[論文レビュー] SelfRecon: Self Reconstruction Your Digital Avatar from Monocular Video

Boyi Jiang, Yang Hong|arXiv (Cornell University)|Jan 30, 2022
Advanced Vision and Imaging被引用数 4
ひとこと要約

SelfRecon は、暗黙的ニューラル表現と明示的メッシュ変形を融合することで、モノクロナル自己回転動画から高精細で時空間的に一貫性のあるデジタルアバター再構成を自己教師付きで行う手法を提案する。微分可能ニューラルレンダリングと一貫性損失を用いて幾何を精緻化すると同時に、周期的なメッシュ更新によりトポロジーの一貫性を維持し、アクター固有のテンプレートを必要としない最新の結果を達成する。

ABSTRACT

We propose SelfRecon, a clothed human body reconstruction method that combines implicit and explicit representations to recover space-time coherent geometries from a monocular self-rotating human video. Explicit methods require a predefined template mesh for a given sequence, while the template is hard to acquire for a specific subject. Meanwhile, the fixed topology limits the reconstruction accuracy and clothing types. Implicit representation supports arbitrary topology and can represent high-fidelity geometry shapes due to its continuous nature. However, it is difficult to integrate multi-frame information to produce a consistent registration sequence for downstream applications. We propose to combine the advantages of both representations. We utilize differential mask loss of the explicit mesh to obtain the coherent overall shape, while the details on the implicit surface are refined with the differentiable neural rendering. Meanwhile, the explicit mesh is updated periodically to adjust its topology changes, and a consistency loss is designed to match both representations. Compared with existing methods, SelfRecon can produce high-fidelity surfaces for arbitrary clothed humans with self-supervised optimization. Extensive experimental results demonstrate its effectiveness on real captured monocular videos. The source code is available at https://github.com/jby1993/SelfReconCode.

研究の動機と目的

  • アクター固有のテンプレートを必要とせずに、モノクロナル自己回転動画から高精細なデジタルアバター再構成を可能にすること。
  • 固定トポロジーテンプレートに依存する明示的手法と、時空間的一致性に欠ける暗黙的手法の限界を克服すること。
  • 任意の服を着た人物に対して、時空間的に一貫性があり、トポロジーが一貫した幾何を自己教師付き最適化により達成すること。
  • 暗黙的表現(任意のトポロジー、高精細)と明示的表現(一貫性、グラフィックスパイプラインとの互換性)の長所を統合すること。

提案手法

  • 固定テンプレートメッシュの代わりに、学習可能な符号付き距離関数(SDF)を標準形状表現として用いる。
  • 前方変形場を適用して標準点を現在のフレーム空間にマップし、時間的に一貫した変形を実現する。
  • 周期的にメッシュを抽出し、変形場を用いて変形・最適化し、微分可能マスク損失と滑らかさ制約を適用する。
  • 画像再構成損失、色、予測された法線マップに基づく微分可能ニューラルレンダリングを用いて幾何の詳細を精緻化する。
  • 暗黙的表面と明示的メッシュを一致させるために一貫性損失を導入し、幾何の忠実性と一貫性を確保する。
  • アーティファクトの防止と最適化の安定性向上を図るため、法線損失に適応的重み付けを適用する。

実験結果

リサーチクエスチョン

  • RQ1暗黙的表現と明示的表現を効果的に統合することで、モノクロナル動画からの時空間的一致性のある3次元再構成を達成できるか?
  • RQ2事前計算されたテンプレートを必要とせず、自己教師付き最適化により高精細な幾何を回復できるように設計できるか?
  • RQ3後退変形と比較して、周期的なメッシュ更新を伴う前方変形は一般化性能を向上させ、最適化の難易度を低下させられるか?
  • RQ4色、マスク、法線マップ損失が幾何的詳細回復と凹みの低減にどの程度寄与するか?
  • RQ5得られたメッシュシーケンスは、アニメーション可能なアバター生成やポーズ駆動レンダリングなどの後続応用をサポートできるか?

主な発見

  • SelfRecon は、実際のモノクロナル自己回転動画において、幾何的忠実性と詳細回復の両面で、既存手法を上回る最新の再構成品質を達成した。
  • アブレーションスタディの結果、マスク、色、法線損失を組み合わせることで凹みが顕著に減少し、表面の現実性が向上した。特に法線損失が不自然な穴を除去する上で不可欠であることが示された。
  • トポロジーが一貫した時空間的一致性を持つメッシュシーケンスを生成し、ポーズ駆動アニメーションやテクスチャマッピングなどの後続応用を可能にした。
  • ニューラルレンダリングの結果は入力画像に視覚的に近く、生成されたアバターはSMPLポーズパラメータによる妥当なドライブをサポートした。
  • 法線損失に適応的重み付けを適用することで、特に低テクスチャ領域においてアーティファクトが抑制され、最適化の安定性が向上した。
  • 高精度な再構成が達成されたが、最適化は依然として計算コストが高く、今後の研究では事前知識や高速レンダリングによる加速が求められる。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。