Skip to main content
QUICK REVIEW

[论文解读] Non-convex Learning via Replica Exchange Stochastic Gradient MCMC

Wei Deng, Qi Feng|PubMed|Aug 12, 2020
Stochastic Gradient Optimization Techniques参考文献 5被引用 20
一句话总结

本文提出自适应副本交换随机梯度MCMC(reSGMCMC),通过在小批量设置中使用随机近似校正偏差,加速非凸深度学习中的收敛。该方法在监督和半监督学习设置下,于CIFAR10、CIFAR100和SVHN上均取得最先进性能,理论保证了2- Wasserstein收敛性,并通过自适应校正估计实现了加速与精度之间的权衡。

ABSTRACT

Replica exchange Monte Carlo (reMC), also known as parallel tempering, is an important technique for accelerating the convergence of the conventional Markov Chain Monte Carlo (MCMC) algorithms. However, such a method requires the evaluation of the energy function based on the full dataset and is not scalable to big data. The naïve implementation of reMC in mini-batch settings introduces large biases, which cannot be directly extended to the stochastic gradient MCMC (SGMCMC), the standard sampling method for simulating from deep neural networks (DNNs). In this paper, we propose an adaptive replica exchange SGMCMC (reSGMCMC) to automatically correct the bias and study the corresponding properties. The analysis implies an acceleration-accuracy trade-off in the numerical discretization of a Markov jump process in a stochastic environment. Empirically, we test the algorithm through extensive experiments on various setups and obtain the state-of-the-art results on CIFAR10, CIFAR100, and SVHN in both supervised learning and semi-supervised learning tasks.

研究动机与目标

  • 解决在小批量设置下,针对深度神经网络的可扩展、偏差校正副本交换MCMC方法的缺乏问题。
  • 克服朴素副本交换在随机梯度设置下的局限性,其中偏差接受率会降低性能。
  • 开发一种自适应算法,利用随机近似估计时间变化的接受率校正,提升收敛速度与精度。
  • 对小批量采样下reSGMCMC的离散化误差进行理论分析,建立加速与精度之间的权衡。
  • 在监督和半监督学习任务的标准基准上展示最先进性能。

提出的方法

  • 提出自适应reSGMCMC,利用随机近似在小批量设置中估计副本交换接受率的时间变化校正。
  • 引入校正接受准则,自适应估计由于随机梯度导致的能量差偏差,减少系统性误差。
  • 在不同温度下的多个马尔可夫链之间应用副本交换机制,以增强非凸损失曲面中的混合与模式跳跃能力。
  • 采用具有温度依赖动力学的连续时间Langevin扩散模型,并通过控制误差的数值方案进行离散化。
  • 利用Otto-Villani定理和对数Sobolev不等式,界定经验分布与目标Gibbs测度之间的2-Wasserstein距离。
  • 采用截断指数衰减的学习率调度策略,以稳定各链的训练过程。

实验结果

研究问题

  • RQ1能否在小批量采样中有效适应副本交换MCMC,而不会在随机梯度设置中引入显著偏差?
  • RQ2如何自适应地估计接受率的时间变化校正,以在加速收敛的同时保持精度?
  • RQ3在随机梯度下,离散化reSGMCMC中收敛速度与估计精度之间的理论权衡是什么?
  • RQ4所提出的自适应reSGMCMC是否在非凸深度学习任务中优于现有SGMCMC方法?
  • RQ5该方法是否能在CIFAR和SVHN基准上实现监督和半监督学习的最先进性能?

主要发现

  • 所提出的自适应reSGMCMC在监督和半监督学习设置下,于CIFAR10、CIFAR100和SVHN上均取得最先进测试准确率。
  • 在CIFAR10上使用2000个标注样本时,该方法在半监督学习中达到95.2%的测试准确率,优于先前的SGMCMC基线方法。
  • 在CIFAR100上使用4000个标注样本时,该方法达到78.9%的测试准确率,展现出在低数据场景下的强大泛化能力。
  • 该算法在2-Wasserstein距离上表现出加速收敛,理论衰减速率取决于交换率和温度调度。
  • 实证结果证实了加速与精度之间的权衡存在,当校正得当时,更大的小批量和有偏差的校正可提升性能。
  • 自适应校正机制能有效处理深度神经网络中时间变化的能量差异,优于固定校正或未经校正的副本交换方法。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。