[論文レビュー] Align Your Gaussians: Text-to-4D with Dynamic 3D Gaussians and Composed Diffusion Models
本論文では、変形場を4次元表現として用いる動的3次元ガウススプラッタリングによるテキストから4次元動的3次元シーンを生成する新規手法Align Your Gaussians (AYG) を提案する。テキストから画像、テキストから動画、3次元に注意を向けたマルチビュー拡散モデルからのスコア蒸留を組み合わせることで、鮮やかで時間的に一貫性があり、幾何学的に正確なアニメーション3次元シーンの生成において最先端の性能を達成した。アトロジティブ拡張およびシーン合成もサポートする。
Text-guided diffusion models have revolutionized image and video generation and have also been successfully used for optimization-based 3D object synthesis. Here, we instead focus on the underexplored text-to-4D setting and synthesize dynamic, animated 3D objects using score distillation methods with an additional temporal dimension. Compared to previous work, we pursue a novel compositional generation-based approach, and combine text-to-image, text-to-video, and 3D-aware multiview diffusion models to provide feedback during 4D object optimization, thereby simultaneously enforcing temporal consistency, high-quality visual appearance and realistic geometry. Our method, called Align Your Gaussians (AYG), leverages dynamic 3D Gaussian Splatting with deformation fields as 4D representation. Crucial to AYG is a novel method to regularize the distribution of the moving 3D Gaussians and thereby stabilize the optimization and induce motion. We also propose a motion amplification mechanism as well as a new autoregressive synthesis scheme to generate and combine multiple 4D sequences for longer generation. These techniques allow us to synthesize vivid dynamic scenes, outperform previous work qualitatively and quantitatively and achieve state-of-the-art text-to-4D performance. Due to the Gaussian 4D representation, different 4D animations can be seamlessly combined, as we demonstrate. AYG opens up promising avenues for animation, simulation and digital content creation as well as synthetic data generation.
研究の動機と目的
- 静的3次元合成や動画生成をはるかに超える、テキストから4次元動的3次元シーン生成のための効果的で効率的な手法の欠如に対処すること。
- テキストプロンプトから高精細で時間的に一貫性があり、幾何学的に正確な3次元オブジェクトのアニメーションを生成すること。
- 変更可能なテキストガイドランスを伴う長時間で多様かつループする4次元シーケンスを生成するためのスケーラブルで合成可能なフレームワークを開発すること。
- 新しい正則化および運動増幅技術を通じて、動く3次元ガウスの最適化を安定化すること。
提案手法
- AYGは変形場を用いて4次元シーンを表現する動的3次元ガウスを使用し、変形場が時間的運動を符号化する。
- テキストから画像、テキストから動画、3次元に注意を向けたマルチビュー拡散モデルの勾配を組み合わせるコンポジショナルスコア蒸留フレームワークを採用する。
- ガウス分布の平均と分散を運動中に保持するための、ジェンセン・ショーンブルグ・ダイバージェンスに基づく新規な正則化法により、最適化を安定化させる。
- テキストから動画モデルからの勾配をスケーリングする運動増幅機構を導入し、明確な運動を強化しながら一貫性を維持する。
- アトロジティブ生成方式により、シーケンス全体で変形場を補間し、4次元アニメーションの延長と変更可能なテキストプロンプトのサポートを実現する。
- ビュー・ガイドランス手法により、4次元生成段階における一貫性のある3次元シーンの初期化を実現し、幾何学的正確性を向上させる。
実験結果
リサーチクエスチョン
- RQ12次元、3次元、動画拡散モデルを組み合わせたコンポジショナル拡散フレームワークは、テキストからの高品質で動的な4次元シーンの生成に効果的に機能するか?
- RQ2動く3次元ガウスの分布をどのように正則化すれば、アニメーション中の最適化の安定性と幾何学的一貫性を維持できるか?
- RQ3運動増幅とアトロジティブ拡張は、進化するテキストガイドランスを伴う長時間で滑らかでループする4次元シーケンスの生成を可能にするか?
- RQ4ガウスベースの4次元表現を用いて、異なる4次元アニメーションをどの程度合成・組み合わせられるか?
- RQ5提案手法は、先行する最先端のアプローチと比較して、定量的および定性的にどの程度優れているか?
主な発見
- AYGは、テキストから4次元生成において最先端の性能を達成し、Make-A-Video3Dなどの先行手法を定量的・定性的な指標で上回った。
- 本手法は、初期ポーズに戻る長時間のアトロジティブに拡張された4次元シーケンスを効果的に生成でき、変更可能なテキストプロンプトを伴うループアニメーションを実現した。
- 運動増幅は、時間的一致性と視覚的品質を維持しながら、明確な運動を顕著に強化した。
- 4次元ガウス表現の使用により、複数の動的4次元シーンのシームレスな合成が可能となり、優れた合成性とモularityを示した。
- fps条件付きのテキストから動画拡散モデルにより、運動強度の柔軟な制御が可能であり、低いfpsではよりダイナミックな運動が得られ、高いfpsでは滑らかな遷移が保証された。
- AYGは、正確なトラッキングラベルを自然に生成するため、下流タスクにおける合成データ生成に極めて適している。
より良い研究を、今すぐ始めましょう
論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。
クレジットカード登録不要
このレビューはAIが作成し、人間の編集者が確認しました。