[论文解读] Online Variance Reduction for Stochastic Optimization
本文提出了一种新颖的在线方差减少方法,用于随机优化,通过使用跟随正则化领导者(FTRL)方法自适应地学习数据点、坐标或块的重要性采样分布。与依赖线性化技巧的先前工作不同,该方法在事后最佳固定分布方面的遗憾为 $\tilde{\mathcal{O}}(n^{1/3}T^{2/3})$,提供了更强的理论保证,并在实验中优于均匀采样和先前的自适应采样方法。
Modern stochastic optimization methods often rely on uniform sampling which is agnostic to the underlying characteristics of the data. This might degrade the convergence by yielding estimates that suffer from a high variance. A possible remedy is to employ non-uniform importance sampling techniques, which take the structure of the dataset into account. In this work, we investigate a recently proposed setting which poses variance reduction as an online optimization problem with bandit feedback. We devise a novel and efficient algorithm for this setting that finds a sequence of importance sampling distributions competitive with the best fixed distribution in hindsight, the first result of this kind. While we present our method for sampling datapoints, it naturally extends to selecting coordinates or even blocks of thereof. Empirical validations underline the benefits of our method in several settings.
研究动机与目标
- 为解决由均匀采样引起的高方差梯度估计问题,该问题忽略了数据结构。
- 开发一种在线学习框架,其中重要性采样分布自适应选择,以最小化累积方差,并在仅具有bandit反馈的情况下进行优化。
- 提供相对于事后最佳固定分布的遗憾保证,克服了先前方法的局限性。
- 将该方法扩展到优化算法中的坐标和块选择。
- 在实际设置中,通过实证验证该方法在降低方差和提升收敛性方面的有效性。
提出的方法
- 使用跟随正则化领导者(FTRL)框架,直接优化正则化累积损失,而不依赖线性化技巧。
- 设计一种bandit反馈机制,其中仅能观测到采样梯度的方差,而非完整梯度。
- 引入一种正则化采样分布,基于历史梯度范数平衡探索与利用。
- 采用一种新颖的分析技术,处理在部分反馈下无界代价函数的问题,使用集中不等式和事件条件化。
- 基于估计的累积梯度范数的倒数,结合正则化参数,推导出一种采样规则。
- 通过将每个坐标或块视为独立的采样单元,将该方法扩展到坐标和块选择。
实验结果
研究问题
- RQ1能否将在线方差减少建模为具有可证明遗憾保证的bandit学习问题?
- RQ2非线性、非线性化的基于FTRL的算法能否优于线性化方法(如EXP3)的遗憾界?
- RQ3所提出的方法在收敛速度和方差减少方面是否优于均匀采样和先前的自适应采样技术?
- RQ4该方法能否自然地扩展到优化中的坐标和块选择?
- RQ5该算法相对于事后最佳固定分布的理论遗憾界是什么?
主要发现
- 所提出的算法在事后最佳重要性采样分布方面的遗憾界为 $\tilde{\mathcal{O}}(n^{1/3}T^{2/3})$。
- 该方法在多个机器学习基准测试中,优于均匀采样和先前的自适应方法,在降低梯度方差方面表现更优。
- 理论分析成功处理了在bandit反馈下无界代价函数的挑战,这是先前工作未解决的关键技术难题。
- 该算法在SGD和坐标下降设置中,经实证验证,收敛速度更快且方差更低,优于当前最先进方法。
- 该方法可推广至坐标和块选择,从而在坐标下降和块迭代求解器中实现方差减少。
- 源代码已公开,便于复现,并可轻松集成到现有优化流程中。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。