[论文解读] Align Your Gaussians: Text-to-4D with Dynamic 3D Gaussians and Composed Diffusion Models
本文提出了一种名为 Align Your Gaussians (AYG) 的新方法,用于通过动态 3D 高斯溅射与形变场作为 4D 表示,实现文本到 4D 动态 3D 场景生成。通过结合文本到图像、文本到视频以及 3D 感知多视角扩散模型的得分蒸馏,AYG 在生成生动、时间一致且几何准确的动态 3D 场景方面达到最先进性能,支持自回归扩展与场景组合。
Text-guided diffusion models have revolutionized image and video generation and have also been successfully used for optimization-based 3D object synthesis. Here, we instead focus on the underexplored text-to-4D setting and synthesize dynamic, animated 3D objects using score distillation methods with an additional temporal dimension. Compared to previous work, we pursue a novel compositional generation-based approach, and combine text-to-image, text-to-video, and 3D-aware multiview diffusion models to provide feedback during 4D object optimization, thereby simultaneously enforcing temporal consistency, high-quality visual appearance and realistic geometry. Our method, called Align Your Gaussians (AYG), leverages dynamic 3D Gaussian Splatting with deformation fields as 4D representation. Crucial to AYG is a novel method to regularize the distribution of the moving 3D Gaussians and thereby stabilize the optimization and induce motion. We also propose a motion amplification mechanism as well as a new autoregressive synthesis scheme to generate and combine multiple 4D sequences for longer generation. These techniques allow us to synthesize vivid dynamic scenes, outperform previous work qualitatively and quantitatively and achieve state-of-the-art text-to-4D performance. Due to the Gaussian 4D representation, different 4D animations can be seamlessly combined, as we demonstrate. AYG opens up promising avenues for animation, simulation and digital content creation as well as synthetic data generation.
研究动机与目标
- 为解决文本到 4D 动态 3D 场景生成缺乏有效方法的问题,该问题超越了静态 3D 合成与视频生成的范畴。
- 实现从文本提示中生成高保真、时间一致且几何准确的 3D 物体动画。
- 开发一种可扩展且可组合的框架,用于生成长时序、多样化且可循环的 4D 序列,并支持动态文本引导。
- 通过新颖的正则化与运动放大技术,稳定移动 3D 高斯的优化过程。
提出的方法
- AYG 使用带有形变场的动态 3D 高斯来表示 4D 场景,其中形变场编码时间运动。
- 其采用一种组合式得分蒸馏框架,结合来自三种扩散模型的梯度:文本到图像、文本到视频以及 3D 感知多视角扩散模型。
- 提出一种基于 Jensen-Shannon 散度的新正则化方法,在运动过程中保持高斯分布的均值与方差,从而稳定优化过程。
- 运动放大机制放大来自文本到视频模型的梯度,以增强可感知运动,同时保持一致性。
- 采用自回归生成方案,在序列间插值形变场,以扩展 4D 动画并支持动态文本提示。
- 视图引导方法确保 4D 生成阶段的 3D 场景初始化一致,从而提升几何保真度。
实验结果
研究问题
- RQ1组合式扩散框架能否有效结合 2D、3D 与视频扩散模型,从文本生成高质量动态 4D 场景?
- RQ2如何对移动 3D 高斯的分布进行正则化,以在动画过程中稳定优化并保持几何一致性?
- RQ3运动放大与自回归扩展是否能够实现长时序、平滑且可循环的 4D 序列,并支持演化的文本引导?
- RQ4基于高斯的 4D 表示在多大程度上可实现不同 4D 动画的组合与融合?
- RQ5所提出方法在定量与定性层面与先前最先进方法相比表现如何?
主要发现
- AYG 在文本到 4D 生成任务中达到最先进性能,其在定性与定量指标上均优于先前方法(如 Make-A-Video3D)。
- 该方法成功生成了长时序、自回归扩展的 4D 序列,可返回初始姿态,实现支持动态文本提示的循环动画。
- 运动放大显著增强了可感知运动,同时保持时间一致性与视觉质量。
- 使用 4D 高斯表示可实现多个动态 4D 场景的无缝组合,展现出强大的可组合性与模块化能力。
- fps 条件化的文本到视频扩散模型可灵活控制运动强度,较低 fps 产生更动态的运动,较高 fps 确保更平滑的过渡。
- AYG 天然生成带有精确跟踪标签的 4D 场景,使其在下游任务中高度适用于合成数据生成。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。