Skip to main content
QUICK REVIEW

[论文解读] Efficient Learning of Generative Models via Finite-Difference Score Matching

Tianyu Pang, Kun Xu|arXiv (Cornell University)|Jul 7, 2020
Model Reduction and Neural Networks被引用 11
一句话总结

本文提出了一种有限差分(FD)得分匹配方法,该方法用高效且可并行化的函数求值替代了得分匹配中高阶梯度的计算。通过使用有限差分近似方向导数来重构得分匹配目标,该方法将计算成本降低了最多2.5倍,同时保持了模型性能并提升了数值稳定性。

ABSTRACT

Several machine learning applications involve the optimization of higher-order derivatives (e.g., gradients of gradients) during training, which can be expensive in respect to memory and computation even with automatic differentiation. As a typical example in generative modeling, score matching (SM) involves the optimization of the trace of a Hessian. To improve computing efficiency, we rewrite the SM objective and its variants in terms of directional derivatives, and present a generic strategy to efficiently approximate any-order directional derivative with finite difference (FD). Our approximation only involves function evaluations, which can be executed in parallel, and no gradient computations. Thus, it reduces the total computational cost while also improving numerical stability. We provide two instantiations by reformulating variants of SM objectives into the FD forms. Empirically, we demonstrate that our methods produce results comparable to the gradient-based counterparts while being much more computationally efficient.

研究动机与目标

  • 解决在得分匹配方法中优化高阶导数(如Hessian迹)带来的高计算成本问题。
  • 克服现有得分匹配变体中顺序梯度计算效率低下和数值不稳定的缺陷。
  • 提出一种通用的、可并行化的算法,用于在无需反向传播的情况下近似任意阶方向导数。
  • 通过消除对不可计算的归一化常数的依赖,实现对能量模型和归一化流等未归一化生成模型的高效训练。
  • 在显著降低训练时间和内存使用的同时,实现与基于梯度的得分匹配相当的性能。

提出的方法

  • 将得分匹配目标(如SSM、DSM)重新表述为二阶方向导数的形式。
  • 提出一种仅依赖函数求值的有限差分(FD)方法,用于近似任意阶方向导数。
  • 将高阶梯度计算分解为独立且可并行化的函数求值,从而降低计算图的深度。
  • 采用步长ε = 0.1的对称有限差分格式,以高效地近似方向导数。
  • 证明在弱条件下,基于FD的损失函数在渐近意义上与基于梯度的对应方法一致。
  • 将FD重构方法应用于未归一化模型,其中不可计算的归一化常数在目标函数中被抵消。

实验结果

研究问题

  • RQ1有限差分近似能否在得分匹配中替代高阶梯度计算,且性能损失最小?
  • RQ2所提出的基于FD的得分匹配是否在计算效率和数值稳定性方面优于基于梯度的方法?
  • RQ3在基于得分的生成模型中,并行函数求值能在多大程度上缩短训练时间?
  • RQ4在随机优化下,基于FD的目标是否与原始得分匹配目标渐近一致?
  • RQ5FD重构方法是否无需架构修改即可应用于显式和隐式生成模型?

主要发现

  • 基于FD的切片得分匹配(FD-SSM)在多个数据集和模型上相比标准SSM实现了超过2.5倍的加速。
  • 基于FD的去噪得分匹配(FD-DSM)相比基线DSM实现了1.5倍的加速,同时保持了相当的对数似然性能。
  • 在MNIST、CIFAR-10、SVHN和CelebA数据集上,模型在对数似然和分布外检测方面的性能与基于梯度的基线相当。
  • FD方法降低了计算图的深度,提升了数值稳定性,并减少了随机优化中的方差。
  • 该方法与未归一化模型兼容,因为不可计算的归一化常数在目标函数中被抵消,从而可直接在未归一化密度上进行训练。
  • 实证结果证实,在弱正则性条件下,基于FD的目标函数与基于梯度的对应方法渐近一致。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。