[论文解读] Adaptive scale-invariant online algorithms for learning linear models
本文提出了一类适用于线性模型的尺度不变在线学习算法,其遗憾界与经最优逐维学习率调优的在线梯度下降(OGD)算法相当(仅在对数因子范围内),且无需任何超参数调优。这些算法对任意特征缩放保持不变,并在每次迭代中保持 O(d) 的运行时间。
We consider online learning with linear models, where the algorithm predicts on sequentially revealed instances (feature vectors), and is compared against the best linear function (comparator) in hindsight. Popular algorithms in this framework, such as Online Gradient Descent (OGD), have parameters (learning rates), which ideally should be tuned based on the scales of the features and the optimal comparator, but these quantities only become available at the end of the learning process. In this paper, we resolve the tuning problem by proposing online algorithms making predictions which are invariant under arbitrary rescaling of the features. The algorithms have no parameters to tune, do not require any prior knowledge on the scale of the instances or the comparator, and achieve regret bounds matching (up to a logarithmic factor) that of OGD with optimally tuned separate learning rates per dimension, while retaining comparable runtime performance.
研究动机与目标
- 解决当特征尺度不一致时在线线性学习性能不佳的问题,这会导致标准在线梯度下降(OGD)因权重更新中单位不匹配而表现下降。
- 消除在在线学习中对特征归一化或对特征尺度与比较器范数的先验知识的需求。
- 设计无需参数的在线算法,对单个特征的任意缩放保持不变,确保无论特征单位如何,预测结果均保持不变。
- 实现遗憾界,与经事后调优的 OGD 使用逐维学习率时的最优遗憾界相当(仅在对数因子范围内)。
- 保持计算效率,每次迭代为 O(d),与标准 OGD 相当。
提出的方法
- 设计一种坐标轴独立的更新规则,其中每个权重独立使用根据局部梯度大小和比较器范数自适应调整的学习率进行更新。
- 引入一种基于势函数的分析方法,受 EGU±(Kivinen & Warmuth, 1997)启发,使用对数障碍函数以确保尺度不变性。
- 设计两种算法——ScInOL 1 和 ScInOL 2,其中 ScInOL 2 采用更具侵略性的更新规则以提升收敛性。
- 通过基于维度的自适应机制,使更新独立于单个特征的尺度,从而实现尺度不变性。
- 使用利普希茨连续的损失函数(如逻辑损失、合页损失、绝对损失),确保梯度有界且与特征向量成比例。
- 通过一种新颖的势函数分析遗憾,该势函数捕捉了预测误差与比较器范数之间的权衡,从而实现紧致的界限。
实验结果
研究问题
- RQ1是否可能在不依赖特征尺度或比较器范数先验知识的前提下,使在线学习算法对单个特征的任意缩放保持不变?
- RQ2是否可能在不调优任何超参数的前提下,实现与经最优调优的逐维学习率 OGD 相当的遗憾界?
- RQ3尺度不变算法是否能在确保对特征尺度变化鲁棒性的同时,保持计算效率(每次迭代 O(d))?
- RQ4在实践中,尺度不变算法与标准自适应方法(如 Adam、AdaGrad 和手动调优学习率的 SGD)相比表现如何?
- RQ5所提出的框架是否可扩展至深度学习模型,以缓解内部协变量偏移问题并减少对批量归一化的依赖?
主要发现
- 所提出的算法 ScInOL 1 和 ScInOL 2 实现的遗憾界与经事后调优的 OGD 使用逐维学习率时的最优遗憾界相当(仅在对数因子范围内)。
- 由于采用了更具侵略性的更新规则,ScInOL 2 在所有测试数据集中均优于 ScInOL 1,表现出更优的收敛性和稳定性。
- 与需要手动调优学习率的 SGD、AdaGrad、Adam 和 NAG 相比,这些算法在多次运行中表现出显著更低的方差。
- 在 MNIST、Covertype 和 Census 等基准数据集上,ScInOL 2 和 CoCoB 在交叉熵损失和准确率方面均取得了最佳测试集性能。
- Alg1-K17(一种先前的尺度不变方法)收敛更慢,尤其在 MNIST 上,这是由于其保守的更新策略。
- 这些算法完全无参数,无需任何预归一化或对特征尺度的先验知识,因此具有更强的鲁棒性,且在真实在线场景中易于部署。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。