[論文レビュー] GaussianAvatars: Photorealistic Head Avatars with Rigged 3D Gaussians
GaussianAvatarsは、パrametricなモーファブルフェイスモデル(FLAME)にライニングされた3次元ガウススプラットを用いて、表情、ポーズ、視点を完全に制御可能な写実的ヘッドアバターを生成する手法を提案する。バインディング継承を用いてFLAMEパラメータとガウススプラットの位置を同時に最適化することで、新しい視点レンダリングおよびリエンアクティブライティングの品質が顕著に向上し、最新の手法を上回る性能を発揮する。
We introduce GaussianAvatars, a new method to create photorealistic head avatars that are fully controllable in terms of expression, pose, and viewpoint. The core idea is a dynamic 3D representation based on 3D Gaussian splats that are rigged to a parametric morphable face model. This combination facilitates photorealistic rendering while allowing for precise animation control via the underlying parametric model, e.g., through expression transfer from a driving sequence or by manually changing the morphable model parameters. We parameterize each splat by a local coordinate frame of a triangle and optimize for explicit displacement offset to obtain a more accurate geometric representation. During avatar reconstruction, we jointly optimize for the morphable model parameters and Gaussian splat parameters in an end-to-end fashion. We demonstrate the animation capabilities of our photorealistic avatar in several challenging scenarios. For instance, we show reenactments from a driving video, where our method outperforms existing works by a significant margin.
研究の動機と目的
- 表情、ポーズ、視点を完全に制御可能な写実的でアニメーション可能なヘッドアバターの作成。
- 動的ヘッドアバターにおいて、高精度な新視点レンダリングと正確なアニメーション制御性を統合する課題の解決。
- NeRFおよび3次元ガウススプラットの動的シーンアニメーションにおける制限を克服し、パラメトリックフェイスモデルによる明示的な幾何制御を統合すること。
- 制約付きのガウススプラット配置により、新規の表情やポーズを含む堅牢なアニメーションを実現しながら視覚的忠実度を維持すること。
- 制御性を損なわずにガウススプラットの動的追加・削除を可能にするバインディング継承戦略の開発。
提案手法
- 本手法は、FLAMEメッシュの各三角形の中心に3次元ガウススプラットを初期化し、各スプラットをその親三角形の運動に従って剛体変換する。
- バインディング継承戦略を導入することで、制御性を保持したままガウススプラットの動的追加・削除を可能にする。
- 位置、スケール、色を含むガウススプラットパラメータとFLAMEパラメータを同時に最適化することで、正確な幾何形状と外観を実現する。
- 位置損失を導入し、ガウススプラットがメッシュ表面に近接して保たれるように制約を課すことで、未知の顔面運動を伴うアニメーション時のアーティファクトを防止する。
- 小さな許容誤差を用いたスケーリング正則化により、ガウススプラットが十分なサイズを維持し、不透明な表面を形成し、隠蔽を適切に処理できるようにする。
- 再構築中にエンドツーエンドでFLAMEパラメータを微調整することで、幾何的正確性と表情忠実度を向上させる。
実験結果
リサーチクエスチョン
- RQ1パラメトリックフェイスモデルに3次元ガウススプラットを効果的にライニングすることで、制御可能で写実的なアバターのアニメーションを実現できるか?
- RQ2制御性と幾何的忠実度を保持したまま、ガウススプラットを動的に追加または削除できるか?
- RQ3どのような最適化戦略が動的ヘッドアバターにおける高精度な新視点レンダリングと正確な表情転送を可能にするか?
- RQ4バインディング継承は、新規の表情やポーズを含むアニメーションにおいて、どの程度の耐性向上をもたらすか?
- RQ5FLAMEとガウスパラメータを同時に最適化する戦略は、分離最適化と比較して視覚的品質と制御性においてどのように優れているか?
主な発見
- GaussianAvatarsは、新視点合成においてPSNR 28.8、SSIM 0.883を達成し、両指標で最新手法を上回る性能を示した。
- 自己リエンアクティブライティングにおいては、PSNR 25.1、SSIM 0.853を達成し、ベースライン手法と比較して顕著に低い知覚誤差を示した。
- アブレーションスタディの結果、バインディング継承を無効化するとPSNRが26.8に低下し、制御不能なガウススプラットのスケーリングと分布が忠実度の著しい低下を引き起こすことが示された。
- スケーリング正則化を無効化しても画像品質はわずかに低下するが、許容誤差の閾値を削除するとPSNRが急激に25.0に低下し、制御されたスケーリングの必要性が明確に示された。
- 位置損失を省略すると、最適な訓練指標(PSNR 29.7)が得られるが、アニメーション中にクラックや飛行するボイド(fly-by blobs)などの深刻なアーティファクトが発生するため、一般化性能の観点から位置損失の重要性が裏付けられた。
- FLAMEの微調整を無効化すると、新視点合成のPSNRが26.1に低下し、リエンアクティブライティングでも知覚誤差が増加するため、幾何的正確性向上に寄与することが確認された。
より良い研究を、今すぐ始めましょう
論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。
クレジットカード登録不要
このレビューはAIが作成し、人間の編集者が確認しました。