Skip to main content
QUICK REVIEW

[论文解读] Understanding and Stabilizing GANs' Training Dynamics with Control Theory

Kun Xu, Chongxuan Li|arXiv (Cornell University)|Sep 29, 2019
Generative Adversarial Networks and Image Synthesis参考文献 40被引用 7
一句话总结

该论文提出CLC-GAN,一种受控制理论启发的方法,通过将闭环控制(CLC)作为判别器输出的L2正则化来稳定GAN训练,在无需谱归一化的情况下,于CIFAR10上实现了SOTA的FID(23)和IS(8.45+),并提升了训练效率与超参数鲁棒性。

ABSTRACT

Generative adversarial networks (GANs) are effective in generating realistic images but the training is often unstable. There are existing efforts that model the training dynamics of GANs in the parameter space but the analysis cannot directly motivate practically effective stabilizing methods. To this end, we present a conceptually novel perspective from control theory to directly model the dynamics of GANs in the function space and provide simple yet effective methods to stabilize GANs' training. We first analyze the training dynamic of a prototypical Dirac GAN and adopt the widely-used closed-loop control (CLC) to improve its stability. We then extend CLC to stabilize the training dynamic of normal GANs, where CLC is implemented as a squared $L2$ regularizer on the output of the discriminator. Empirical results show that our method can effectively stabilize the training and obtain state-of-the-art performance on data generation tasks.

研究动机与目标

  • 为解决GAN训练中的不稳定性问题,该问题常导致优化过程发散与振荡。
  • 开发一种理论基础扎实、实际有效的GAN稳定方法,超越启发式正则化。
  • 通过建模函数空间动力学并应用反馈控制原理,弥合控制理论与GAN训练动力学之间的鸿沟。
  • 在提升收敛性与计算效率的同时,实现SOTA的图像生成性能。

提出的方法

  • 使用控制理论,特别是闭环控制(CLC),在函数空间中建模GAN训练动力学,以稳定学习过程。
  • 将CLC作为判别器输出的平方L2正则化项,惩罚过大的激活值,从而提升稳定性。
  • 利用拉普拉斯变换分析典型狄拉克GAN的频域动力学,实现理论上的稳定性保证。
  • 通过函数空间动力学的局部线性化,将CLC框架从线性狄拉克GAN扩展至非线性普通GAN。
  • 以极低的计算开销实现CLC-GAN,避免昂贵的梯度惩罚或依赖归一化层的架构。
  • 将CLC与多种GAN目标函数和架构(包括SN-GAN)结合,验证其泛化性与鲁棒性。

实验结果

研究问题

  • RQ1控制理论能否为理解与稳定函数空间中的GAN训练动力学提供一个原则性框架?
  • RQ2与现有正则化方法相比,闭环控制(CLC)如何提升GAN的稳定性?
  • RQ3CLC能否有效从线性狄拉克GAN推广至具有真实世界数据的非线性、实用GAN?
  • RQ4CLC-GAN对不同架构与目标函数的训练效率、收敛速度及图像生成质量有何影响?
  • RQ5CLC-GAN对超参数λ(正则化强度)的敏感度如何,特别是在使用批量归一化或谱归一化时?

主要发现

  • CLC-GAN在CIFAR10上实现了SOTA的FID 23,相比Reg-GAN(FID 28)提升了5分。
  • 在无需谱归一化的情况下,CLC-GAN在CIFAR10上实现了超过8.45的Inception Score(IS),优于先前的SOTA GAN模型。
  • 在CelebA上,CLC-GAN每秒可训练约8次,而Reg-GAN在同一硬件上仅能达到每秒4次。
  • CLC-GAN在不同架构与目标函数下均保持优异性能,包括SN-GAN,而大多数基于梯度的正则化方法在该设置下无法提升性能。
  • CLC-GAN对超参数λ具有鲁棒性:使用批量归一化时,λ = 2、5、10均能获得SOTA的IS;使用谱归一化时,λ = 0.1、0.05、0.2均能实现IS > 8.4(使用铰链损失)。
  • CLC-GAN生成的样本在语义上具有意义,且与强基线模型生成的样本相当,如CIFAR10与CelebA上的定性结果所示。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。