Skip to main content
QUICK REVIEW

[论文解读] Normalized Online Learning

Stéphane Ross, Paul Mineiro|arXiv (Cornell University)|May 28, 2013
Advanced Bandit Algorithms Research参考文献 18被引用 9
一句话总结

本文提出了一种归一化自适应梯度(NAG),一种对特征缩放不变的在线学习算法,通过使用特征维度的几何平均值对梯度进行归一化。其遗憾边界依赖于特征尺度的比值而非绝对尺度,从而在无需预归一化的情况下实现鲁棒性能,减少超参数调优,并在未经归一化的数据上优于标准自适应方法,同时保持计算效率。

ABSTRACT

We introduce online learning algorithms which are independent of feature scales, proving regret bounds dependent on the ratio of scales existent in the data rather than the absolute scale. This has several useful effects: there is no need to pre-normalize data, the test-time and test-space complexity are reduced, and the algorithms are more robust.

研究动机与目标

  • 开发对特征缩放不变的在线学习算法,从而消除对预处理归一化的依赖。
  • 解决标准在线方法对对抗性特征缩放的脆弱性,该问题可能导致遗憾无界。
  • 通过消除对特征尺度归一化的依赖,减少在线学习中的计算与超参数开销。
  • 证明仅依赖于特征尺度比值而非其绝对值的有限遗憾边界。
  • 通过实证验证,该算法在无需归一化的情况下,性能可与预归一化方法相媲美。

提出的方法

  • 提出一种归一化在线更新规则,通过特征幅度的几何平均值对梯度进行缩放,确保对单个特征缩放的不变性。
  • 引入一种缩放对抗者模型,以形式化分析在线学习中对任意特征重缩放的鲁棒性。
  • 推导出依赖于最大与最小特征尺度比值的遗憾边界,而非绝对范数。
  • 将该归一化方法应用于自适应梯度方法(例如Adagrad),从而得到归一化自适应梯度(NAG)。
  • 使用渐进验证和全面的超参数搜索,将NAG与标准自适应梯度在未经归一化和预归一化数据集上进行比较。
  • 在具有异质特征尺度的多样化公开数据集上对NAG进行实证评估,以证明其鲁棒性与对调参的低敏感性。

实验结果

研究问题

  • RQ1是否可以在不依赖预归一化的情况下,使在线学习算法对特征缩放保持不变?
  • RQ2对抗性特征缩放如何影响标准在线学习算法的遗憾边界?
  • RQ3归一化更新规则能否实现与绝对特征尺度无关的遗憾边界?
  • RQ4与标准自适应方法相比,NAG是否减少了对超参数调优的需求?
  • RQ5在真实世界的未经归一化数据集上,NAG相对于预归一化自适应梯度的性能如何?

主要发现

  • NAG的性能与在预归一化数据上应用自适应梯度的性能相当,有效消除了对预处理归一化的依赖。
  • 在Covertype数据集上,NAG将多分类0-1损失降低了5%,表明在高度异质数据上具有显著优势。
  • NAG的最优学习率在所有数据集上均稳定在[0.01, 10]范围内,显著缩小了超参数搜索空间。
  • 即使在预归一化后,NAG的最优学习率范围也远小于标准自适应梯度,表明其调参负担显著降低。
  • sNAG(平方范数版本)在对抗异常值方面表现出略优的鲁棒性,且计算成本仅略有增加。
  • 预归一化消除了NAG与自适应梯度之间的性能差异,证实NAG有效消除了对归一化的需求。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。