[论文解读] Training Generative Adversarial Networks by Solving Ordinary Differential Equations
本文提出通过求解生成对抗网络(GANs)训练动态背后的连续时间常微分方程(ODEs),而非依赖离散梯度更新来训练 GANs。通过使用如 Runge-Kutta 等高阶 ODE 求解器,并引入简单的梯度正则化以控制积分误差,该方法在无需自适应优化器(如 Adam)或谱归一化的情况下实现了稳定训练,在 CIFAR-10 和 ImageNet 上的表现优于强基线模型。
The instability of Generative Adversarial Network (GAN) training has frequently been attributed to gradient descent. Consequently, recent methods have aimed to tailor the models and training procedures to stabilise the discrete updates. In contrast, we study the continuous-time dynamics induced by GAN training. Both theory and toy experiments suggest that these dynamics are in fact surprisingly stable. From this perspective, we hypothesise that instabilities in training GANs arise from the integration error in discretising the continuous dynamics. We experimentally verify that well-known ODE solvers (such as Runge-Kutta) can stabilise training - when combined with a regulariser that controls the integration error. Our approach represents a radical departure from previous methods which typically use adaptive optimisation and stabilisation techniques that constrain the functional space (e.g. Spectral Normalisation). Evaluation on CIFAR-10 and ImageNet shows that our method outperforms several strong baselines, demonstrating its efficacy.
研究动机与目标
- 探究 GAN 训练中的不稳定性是否源于梯度更新中的离散化误差,而非固有的动力学特性。
- 探讨 GAN 的连续时间动力学是否本质上是稳定的,暗示不稳定的根源在于积分不准确。
- 开发一种通过精确求解底层 ODE 来稳定 GAN 训练的方法,减少对复杂正则化或自适应优化器的依赖。
- 证明高阶 ODE 求解器可在无需谱归一化或 Adam 的情况下提升 GAN 的收敛性和性能。
提出的方法
- 作者通过在梯度下降更新中取无穷小时间步的极限,将 GAN 训练建模为连续动力系统。
- 他们推导出判别器和生成器参数的连续时间 ODE 系统,其受损失函数梯度的支配。
- 他们采用标准的高阶 ODE 求解器(如 Runge-Kutta (RK4))来积分连续动力学,而非使用离散更新。
- 引入梯度正则化以控制积分误差,防止 ODE 轨迹出现大幅偏离。
- 该方法避免使用谱归一化和 Adam 等自适应优化器,转而依赖精确的数值积分。
- 该方法在 CIFAR-10 和 ImageNet 上使用 FID 和 Inception Score 等标准指标进行了评估。
实验结果
研究问题
- RQ1GAN 训练中的不稳定性是否主要源于梯度更新中的离散化误差,而非连续动力学本身的不稳定性?
- RQ2在不依赖 Adam 等先进优化技术的情况下,高阶 ODE 求解器能否稳定 GAN 训练?
- RQ3对生成器梯度的简单正则化是否能有效控制积分误差并提升训练稳定性?
- RQ4是否可以在不使用谱归一化或其他函数空间约束的情况下,将 GAN 训练至具有竞争力的性能?
主要发现
- ODE-GAN 搭配 RK4 求解器在 CIFAR-10 上实现了 11.85 ± 0.21 的 FID,优于多个强基线模型,包括 SN-GAN 和 WGAN-GP。
- 在 ImageNet 128×128 上,ODE-GAN 实现了 26.16 ± 0.75 的 FID,优于 SN-GAN 和 WGAN-ALP 在相似设置下的表现。
- 该方法在不使用 Adam 或谱归一化的情况下实现了具有竞争力的性能,表明当积分误差得到控制时,这些组件并非必需。
- 实证结果表明,当使用高阶 ODE 求解器时,Adam 和谱归一化反而可能损害收敛性,暗示它们可能干扰稳定积分。
- 研究发现,在适度假设下 GAN 的连续动力学本质上是稳定的,当精确积分时,收敛性与旋转分量无关。
- 使用高阶 ODE 求解器可带来更好的收敛性和更优的样本质量,即使在梯度估计存在噪声的情况下亦然。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。