[论文解读] Minimizing Trajectory Curvature of ODE-based Generative Models
本文提出一种方法,通过训练前向过程以减少轨迹之间的交叉,从而最小化基于 ODE 的生成模型中的轨迹曲率,实现更低的截断误差和更快的采样速度。通过将问题表述为时间条件化的 β-VAE,该方法在训练过程中无需 ODE 模拟,即可显著降低 FID 分数(例如,在 5 次函数评估下,FID 为 18.74 对比基线的 37.19)。
Recent ODE/SDE-based generative models, such as diffusion models, rectified flows, and flow matching, define a generative process as a time reversal of a fixed forward process. Even though these models show impressive performance on large-scale datasets, numerical simulation requires multiple evaluations of a neural network, leading to a slow sampling speed. We attribute the reason to the high curvature of the learned generative trajectories, as it is directly related to the truncation error of a numerical solver. Based on the relationship between the forward process and the curvature, here we present an efficient method of training the forward process to minimize the curvature of generative trajectories without any ODE/SDE simulation. Experiments show that our method achieves a lower curvature than previous models and, therefore, decreased sampling costs while maintaining competitive performance. Code is available at https://github.com/sangyun884/fast-ode.
研究动机与目标
- 为解决基于 ODE 的生成模型中因轨迹曲率高而导致的高采样成本问题,该问题源于数值求解器中的高截断误差。
- 探究在修正流(rectified flow)及基于 ODE/SDE 的模型中,前向轨迹交叉与反向轨迹曲率之间的关系。
- 开发一种在训练过程中无需 ODE 模拟即可最小化轨迹曲率的训练方法。
- 实现在函数评估次数更少的前提下实现更快采样,同时保持具有竞争力的生成性能。
- 为现有基于 ODE 的生成模型加速技术提供一种互补且高效的替代方案。
提出的方法
- 该方法通过最小化前向轨迹之间的交叉程度来减少反向轨迹的曲率,而交叉程度与反向轨迹曲率密切相关。
- 将前向过程建模为时间条件化的 β-VAE 框架中的解码器,其中潜在变量以时间与输入数据为条件。
- 使用变分目标进行训练,通过按 β 缩放的 KL 散度项来惩罚高交叉程度。
- 通过鼓励前向轨迹发散,避免其汇聚于同一路径,从而隐式实现曲率降低。
- 该方法在训练过程中无需 ODE 模拟,因此计算效率高且可扩展。
- 该方法与现有基于 ODE/SDE 的模型兼容,可与其他加速技术结合使用。
实验结果
研究问题
- RQ1在基于 ODE 的模型中,前向轨迹的交叉程度与反向生成轨迹的曲率之间存在何种关系?
- RQ2能否在不进行 ODE 模拟的前提下,通过减少前向轨迹交叉来降低反向过程的曲率?
- RQ3曲率最小化在减少函数评估次数的前提下,能在多大程度上提升采样效率?
- RQ4在有限采样预算下,该方法与基线 ODE 模型在 FID 分数和样本质量方面相比如何?
- RQ5该方法是否可泛化至不同架构和数据集而无需重新训练?
主要发现
- 在仅使用 5 次函数评估(NFE)的情况下,该方法在 CIFAR-10 上实现了 18.74 的 FID 分数,显著优于基线的 37.19。
- 即使在使用 RK45 求解器进行完整 ODE 模拟的情况下,β=20 的方法在所有 NFE 设置下均表现出更优的样本质量。
- 与先前模型相比,该方法更有效地降低了轨迹曲率,从而在数值求解器中产生更低的截断误差。
- 该方法在蒸馏任务中表现更优,能够生成高质量的一步式学生模型,且蒸馏误差更低。
- 该方法在不同数据集上均表现稳健,在 MNIST、CIFAR-10 和 CelebAHQ(64×64)上均展现出一致的性能提升。
- 高 β 值(如 20)在所有采样预算下均持续优于基线,显著减少了对人工超参数调优的需求。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。