[論文レビュー] Textured Neural Avatars
本稿では、3次元関節位置とカメラパrameterから2次元テクスチャマップを明示的にモデル化し、完全畳み込みネットワークを用いてテクスチャ座標を予測することで、新しいポーズやカメラビュー下での人物の全身画像をレンダリングするテクスチャ付きニューラルアバターを提案する。この手法は、直接的な画像間変換手法と比較して、特に限られた学習データ下でもより優れた一般化性能と現実性を達成する。
We present a system for learning full-body neural avatars, i.e. deep networks that produce full-body renderings of a person for varying body pose and camera position. Our system takes the middle path between the classical graphics pipeline and the recent deep learning approaches that generate images of humans using image-to-image translation. In particular, our system estimates an explicit two-dimensional texture map of the model surface. At the same time, it abstains from explicit shape modeling in 3D. Instead, at test time, the system uses a fully-convolutional network to directly map the configuration of body feature points w.r.t. the camera to the 2D texture coordinates of individual pixels in the image frame. We show that such a system is capable of learning to generate realistic renderings while being trained on videos annotated with 3D poses and foreground masks. We also demonstrate that maintaining an explicit texture representation helps our system to achieve better generalization compared to systems that use direct image-to-image translation.
研究の動機と目的
- 限られた学習データ下でも新しいポーズやカメラビューにうまく一般化できるニューラルアバターシステムの開発を目的とする。
- 2次元テクスチャマップを明示的にモデル化することで、直接的な画像間変換ネットワークよりも一般化性能を向上させる。
- 古典的グラフィックス(テクスチャの分離)の長所とディープラーニング(エンドツーエンドレンダリング)の長所を統合する。
- 単眼動画からの学習を可能とし、最小限のデータで新しい人物に転移できるようにする。
- 限られた監視信号のもとでも、新しい視点やポーズにおける一般化のロバスト性と現実性を示す。
提案手法
- 本システムは、3次元関節位置とカメラパラメータに基づき、各ピクセルの2次元テクスチャ座標を予測する完全畳み込みネットワークを用いる。
- 前景/背景マスクを同時に予測し、ボディ表面の明示的な2次元テクスチャマップを維持する。
- 3次元ポーズと前景マスクのアノテーションが付与された動画上でエンドツーエンドに学習され、明示的な3次元形状モデリングは行わない。
- 新しい人物の微調整時にテクスチャマップを初期化から再構築することで、1本の動画からのゼロショット転移を可能にする。
- 幾何と外観を分離することで、ポーズや視点の変化に対する一般化を向上させるために、テクスチャを事前知識として活用する。
- 予測されたテクスチャ座標を最終画像ピクセルにマップする微分可能レンダリングパイプラインを用いる。
実験結果
リサーチクエスチョン
- RQ1限られた単眼動画データで学習するニューラルアバターにおいて、明示的なテクスチャ表現が一般化性能を向上させるか?
- RQ2新しい視点やポーズにおける一般化性能において、テクスチャに配慮したニューラルアバターは、直接的な動画間変換(V2V)と比較してどの程度優れているか?
- RQ31本の単眼動画のみを用いて、ニューラルアバターを新しい人物にどの程度転送できるか?
- RQ4エンドツーエンドの画像間変換と比較して、明示的なテクスチャマップを維持することでアーチファクトが減少し、現実性が向上するか?
- RQ5特に手や顔の部分において、ポーズ推定の誤差に対して、このシステムはどの程度ロバストか?
主な発見
- 本手法はSSIMの観点で動画間変換(V2V)を上回り、ユーザースタディーでも好まれており、より優れた知覚的品質と一般化性能を示している。
- 1本の動画からの転送において、本手法は55%および65%のユーザーコンパリISONでV2Vを上回り、優れた少サンプル一般化性能を示している。
- 本システムは、1本のYouTube動画からも妥当なアバターを生成できたが、一部の手のアーチファクトが残存していた。
- 定量的評価ではSSIMが優れており、FIDスコアも競争力があるが、V2Vに比べてわずかに劣っているため、指標と知覚的品質のトレードオフがあることが示唆された。
- スケールが学習データと著しく異なる場合、一般化性能が著しく低下するため、スケール不変性に限界があることが示された。
- ポーズ推定の誤差に対してはアーチファクトが顕著に現れ、特に手や顔の部分で感受性が高く、キーポイントの正確性に依存することが浮き彫りになった。
より良い研究を、今すぐ始めましょう
論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。
クレジットカード登録不要
このレビューはAIが作成し、人間の編集者が確認しました。