[论文解读] Reducing Noise in GAN Training with Variance Reduced Extragradient
本文提出 SVRE,一种随机方差降低的外推梯度算法,用以减轻 GAN 训练中的梯度噪声并实现更好收敛,在 MNIST、CIFAR-10、SVHN 和 ImageNet 变体上取得显著的经验性提升。
We study the effect of the stochastic gradient noise on the training of generative adversarial networks (GANs) and show that it can prevent the convergence of standard game optimization methods, while the batch version converges. We address this issue with a novel stochastic variance-reduced extragradient (SVRE) optimization algorithm, which for a large class of games improves upon the previous convergence rates proposed in the literature. We observe empirically that SVRE performs similarly to a batch method on MNIST while being computationally cheaper, and that SVRE yields more stable GAN training on standard datasets.
研究动机与目标
- 强调随机梯度噪声如何影响 GAN 训练和博弈优化中的收敛。
- 提出并给出 SVRE 以降低 GAN 中的梯度方差的公式化方法。
- 在强单调性和共增性假设下,给出 SVRE 的理论收敛保证。
- 在标准数据集上对 SVRE 进行经验评估,以评估稳定性、收敛速度和样本质量。
- 在 GAN 设置中将 SVRE 与批量外推梯度法和标准随机方法进行比较。
提出的方法
- 将 GAN 训练表述为生成器与判别器之间的两人可微博弈。
- 通过将 SVRG 梯度估计与外推梯度(EG)框架结合,引入随机方差降低的外推梯度(SVRE)。
- 使用快照 omega^S 及其对应的全梯度 mu^S 构造每个参与者的无偏梯度估计 d_i^G 和 d_i^D。
- 结合由共增性导出的常数引导的非均匀采样 pi_i,并为 SVRE 实现几何/蒙特卡洛样本的时期抽样(q-记忆)。
- 给出收敛定理(定理 2),在假设 1(强单调性、共增性、规则性)及合适的步长下,显示期望平方误差的衰减。
- 给出一个有说服力的简单随机双线性博弈,说明 SEG 的噪声引起的发散,并展示 SVRE 的韧性。
实验结果
研究问题
- RQ1将 GAN 训练框架成两人博弈时,随机梯度噪声如何影响收敛?
- RQ2方差减少技术能否有效扩展到博弈优化以提高稳定性和收敛性?
- RQ3在强单调性、共增性和正则性方面,SVRE 的理论收敛保证是什么?
- RQ4基于 SVRE 的 GAN 在标准数据集上是否能获得与批量外推梯度和普通随机方法竞争甚至优越的性能与稳定性?
主要发现
- 随机梯度可能导致外推梯度方法在 GAN 风格博弈中发散,即使批量方法能够收敛。
- SVRE 通过在外推梯度框架内利用 SVRG 风格的梯度估计来降低博弈中的梯度方差。
- 理论结果:SVRE 在局部强单调性和共增性下收敛,收敛速率依赖于 mu、ell 和正则性常数(定理 2)。
- 经验上,SVRE 在 MNIST 上与批量方法表现相近但计算成本更低,在使用深度结构的 CIFAR-10 和 SVHN 上实现更稳定的 GAN 训练。
- 在 CIFAR-10 和 SVHN 使用深度结构时,SVRE 相较于 SG-A 与 SE-A 基线获得了更好的 FID 分数(CIFAR-10: 16.77 对比 WS-SVRE 与 21.70 SG-A、18.65 SE-A、23.56 SVRE;SVHN: 4.88 WS-SVRE 对比 5.66 SG-A、5.14 SE-A、4.81 SVRE)。
- 带暖启动的 SVRE 变体(WS-SVRE)可在基线不稳定后继续提升性能,而不产生发散。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。