[论文解读] Whitening and Coloring batch transform for GANs
本论文提出了一种去相关化与着色化(Whitening and Coloring, WC)批量归一化变换,以提升生成对抗网络(GANs)和条件生成对抗网络(cGANs)的训练稳定性和生成质量。通过使用Cholesky分解实现完整特征去相关化,并以可学习的多变量着色变换替代标准批量归一化,该方法增强了表征能力,并在cGANs中实现了更有效的类别特定条件控制,从而在CIFAR-10和CIFAR-100数据集上取得了当前最优的FID分数。
Batch Normalization (BN) is a common technique used to speed-up and stabilize training. On the other hand, the learnable parameters of BN are commonly used in conditional Generative Adversarial Networks (cGANs) for representing class-specific information using conditional Batch Normalization (cBN). In this paper we propose to generalize both BN and cBN using a Whitening and Coloring based batch normalization. We show that our conditional Coloring can represent categorical conditioning information which largely helps the cGAN qualitative results. Moreover, we show that full-feature whitening is important in a general GAN scenario in which the training process is known to be highly unstable. We test our approach on different datasets and using different GAN networks and training protocols, showing a consistent improvement in all the tested frameworks. Our CIFAR-10 conditioned results are higher than all previous works on this dataset.
研究动机与目标
- 通过完整特征去相关化改进损失景观的条件性,以解决GAN训练的不稳定性问题。
- 通过将标量缩放-偏移参数替换为可学习的多变量着色滤波器,推广条件批量归一化(cBN),以实现更优的类别特定表征。
- 通过使用共享的、与类别无关的滤波器字典与软分配权重,减少cGAN中参数数量,降低模型复杂度。
- 在多个数据集和GAN架构上,持续提升训练速度与生成质量。
提出的方法
- 采用基于Cholesky分解的去相关化方法,对小批量样本中通道间的特征进行去相关处理,替代标准BN的逐通道归一化。
- 引入可学习的着色变换,利用多变量滤波器将去相关后的特征重新投影到新分布中,从而保留表征能力。
- 在cGAN中,将cBN的标量γ和β参数替换为类别特定的着色矩阵Γy,实现更丰富、更具表达力的条件特征变换。
- 采用软分配机制,使每个类别y与一组共享基础滤波器的加权组合相关联,从而减少随类别数量增长的参数量。
- 将WC和cWC模块作为即插即用的组件集成到生成器网络中,与标准GAN训练协议兼容。
- 使用标准对抗损失进行训练,所有生成器层均应用WC变换,并通过Inception Score(IS)和Fréchet Inception Distance(FID)进行评估。
实验结果
研究问题
- RQ1通过Cholesky分解实现的完整特征去相关化,是否相比标准批量归一化能提升GAN的训练稳定性和收敛性?
- RQ2在cGAN中,将标量cBN参数替换为可学习的多变量着色矩阵,是否能增强类别特定信息的表征能力?
- RQ3所提出的着色滤波器软分配机制在类别数量增加时,如何影响模型复杂度与性能?
- RQ4与判别性任务相比,WC变换在GAN中是否相比BN和DBN具有显著优势?
- RQ5所提出方法是否能在CIFAR-10和CIFAR-100等标准基准上,在无条件和条件GAN设置下均实现当前最优性能?
主要发现
- 所提出的WC方法在CIFAR-10上实现了13.5的Fréchet Inception Distance(FID)分数,优于该基准上的所有先前工作。
- 在CIFAR-100上,cWC方法实现了9.52的Inception Score和17.2的FID分数,显著优于cBN和c-std-C基线模型。
- cWC-diag变体(使用对角线着色矩阵)在CIFAR-100上的表现劣于完整cWC,表明在高类别数设置下,完整去相关与多变量着色至关重要。
- 软分配变体$cWC_{sa}$有效降低了随类别数增长的参数量,并在Tiny ImageNet上实现了优于标准cWC的性能,证明了其可扩展性。
- 在判别性分类任务中,WC与DBN(基于ZCA的去相关化+缩放)性能相当,但在GAN中性能差距显著更大,表明完整去相关化在对抗训练中更为关键。
- 消融实验表明,完整去相关化后进行着色是必不可少的——仅使用标准化的c-std-C和cWC变体,即使参数量相同,也无法达到完整WC的性能。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。