[论文解读] Online Learning to Sample
本文提出自适应加权随机梯度下降(AW-SGD),一种在线学习方法,通过动态优化训练样本的采样分布,以减少随机梯度下降中的梯度方差。通过使用第二个SGD过程联合学习模型参数和重要性采样权重,AW-SGD在图像分类、矩阵分解和强化学习任务中均实现了更快的收敛速度,当数据访问时间差异显著时,速度提升最高可达100倍。
Stochastic Gradient Descent (SGD) is one of the most widely used techniques for online optimization in machine learning. In this work, we accelerate SGD by adaptively learning how to sample the most useful training examples at each time step. First, we show that SGD can be used to learn the best possible sampling distribution of an importance sampling estimator. Second, we show that the sampling distribution of an SGD algorithm can be estimated online by incrementally minimizing the variance of the gradient. The resulting algorithm - called Adaptive Weighted SGD (AW-SGD) - maintains a set of parameters to optimize, as well as a set of parameters to sample learning examples. We show that AWSGD yields faster convergence in three different applications: (i) image classification with deep features, where the sampling of images depends on their labels, (ii) matrix factorization, where rows and columns are not sampled uniformly, and (iii) reinforcement learning, where the optimized and exploration policies are estimated at the same time, where our approach corresponds to an off-policy gradient algorithm.
研究动机与目标
- 通过学习训练样本的最优自适应采样分布,加速随机梯度下降(SGD)。
- 通过将采样分布视为可学习参数,减少在线学习中梯度估计的方差。
- 将采样分布学习整合到主优化循环中,实现模型与采样策略的联合优化。
- 在数据访问特性各异的多样化机器学习应用中,验证该方法的有效性。
- 表明学习采样权重的开销可通过更快的收敛速度得到补偿,尤其在数据访问时间异构的场景下。
提出的方法
- AW-SGD使用两个并行的SGD过程:一个用于模型参数 $w_t$,另一个用于采样分布参数 $\tau_t$。
- 采样分布 $q(x; \tau_t)$ 通过梯度估计方差的梯度在线更新。
- $\tau_t$ 的更新规则基于最小化梯度估计方差推导得出,更新方向为 $\|d_t\|^2 \nabla_\tau \log q(x_t; \tau_t)$。
- 该算法维护一种时间感知变体,其中采样成本被建模为数据访问时间的函数,从而在I/O受限环境中实现加速。
- 该方法具有通用性,可应用于任何涉及不可计算期望的目标,包括变分推断和对数配分估计。
- 通过学习以优化或指导其他算法,该方法可扩展至控制变量和元学习框架。
实验结果
研究问题
- RQ1能否使用随机梯度下降来学习最小化梯度方差的最优采样分布?
- RQ2联合学习采样分布和模型参数是否比均匀采样带来更快的收敛速度?
- RQ3在分布式或慢速存储系统等场景下,AW-SGD在异构数据访问时间下的性能表现如何?
- RQ4AW-SGD能否推广到标准监督学习之外的非均匀采样问题,如矩阵分解和强化学习?
- RQ5学习采样分布的计算开销与收敛速度提升之间的权衡是什么?
主要发现
- 当数据访问时间差异显著时(如从硬盘读取,f=50,000),AW-SGD相比标准SGD速度提升最高可达100倍。
- 在慢速访问因子f=5000(网络内存)的情况下,AW-SGD相比SGD实现10倍速度提升,表明在I/O受限环境中性能显著增强。
- 当f≥200(SSD级别访问)时,时间感知的AW-SGD优于标准SGD,表明采样开销被更智能的采样策略所补偿。
- 在图像分类和矩阵分解任务中,即使数据访问均匀,AW-SGD也因方差减少而比标准SGD收敛更快。
- 当访问时间均匀时,该算法的收敛速度与标准SGD相当,证实其在有利条件下不会降低性能。
- 该方法在不同领域泛化良好,在深度学习、矩阵分解和强化学习中均表现出一致的性能提升。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。