[论文解读] Stochastic Gradient Estimate Variance in Contrastive Divergence and Persistent Contrastive Divergence
本文通过实证研究对比了在训练受限玻尔兹曼机时,对比散度(CD)与持续对比散度(PCD)中随机梯度估计的方差。研究发现,CD-1的梯度估计方差显著低于精确采样,而PCD由于采样相关性,其后续估计均值的方差显著升高,这解释了为何PCD通常需要更小的学习率或更大的小批量。
Contrastive Divergence (CD) and Persistent Contrastive Divergence (PCD) are popular methods for training the weights of Restricted Boltzmann Machines. However, both methods use an approximate method for sampling from the model distribution. As a side effect, these approximations yield significantly different biases and variances for stochastic gradient estimates of individual data points. It is well known that CD yields a biased gradient estimate. In this paper we however show empirically that CD has a lower stochastic gradient estimate variance than exact sampling, while the mean of subsequent PCD estimates has a higher variance than exact sampling. The results give one explanation to the finding that CD can be used with smaller minibatches or higher learning rates than PCD.
研究动机与目标
- 研究CD与PCD中随机梯度估计的方差,作为影响训练速度和超参数选择的因素。
- 确定CD所宣称的低方差是否源于近似采样,或源于更接近数据分布。
- 分析PCD中相关更新对梯度估计方差的影响,尤其在训练后期阶段。
- 在多个数据集和训练阶段中,比较CD、PCD与精确采样的梯度方差。
- 为CD与PCD之间学习率需求差异提供实证依据。
提出的方法
- 在三个数据集上训练受限玻尔兹曼机:二值化MNIST、CIFAR-10中心图像块、Caltech 101轮廓图。
- 通过CD-k(k=1至10)、PCD、CD-1000(近似精确采样)和独立CD(I-CD)评估梯度估计方差。
- 对每个数据点测量10次梯度样本,并在10次不同的权重初始化下计算每条权重矩阵元素的方差。
- 使用固定的可见单元和隐藏单元数量,偏置初始化为零,权重初始化为小随机值。
- 在第10和第500个周期计算梯度估计的方差,以评估训练过程中的变化。
- 通过计算PCD与CD-1000在k个后续估计均值的方差比值,比较PCD与CD-1000。
实验结果
研究问题
- RQ1CD是否比精确采样具有更低的随机梯度估计方差?如果是,原因是什么?
- RQ2PCD梯度估计的方差与独立采样相比如何?其方差是否随训练过程增加?
- RQ3CD的方差优势是源于从正样本粒子采样,还是源于采样步数有限?
- RQ4PCD更新之间的相关性在多大程度上增加了均值梯度估计的方差?
- RQ5CD与PCD之间学习率需求的差异是否可由梯度估计方差解释?
主要发现
- CD-1的梯度估计方差显著低于精确采样,且随着CD步数增加,方差仅略有上升。
- CD相较于精确采样的方差优势主要源于从正样本粒子采样负样本,而非采样步数有限。
- 独立CD(I-CD)失去了方差优势,表明与正样本粒子的接近程度是CD低方差的关键。
- PCD后续梯度估计的均值方差显著高于独立采样,尤其在训练后期阶段更为明显。
- 对于CD-1,10次后续估计的均值方差仅为PCD的数倍,表明PCD需要更小的学习率或更大的小批量。
- 结果实证证实,CD收敛更快部分归因于更低的梯度方差,而PCD的高方差则解释了其需要更小学习率的原因。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。