Skip to main content
QUICK REVIEW

[论文解读] MetaGrad: Multiple Learning Rates in Online Learning

Tim van Erven, Wouter M. Koolen|arXiv (Cornell University)|Apr 29, 2016
Advanced Bandit Algorithms Research参考文献 39被引用 20
一句话总结

MetaGrad 是一种自适应在线学习算法,通过基于经验性能的主算法动态组合多种学习率,实现对广泛函数类(包括指数凸、强凸以及无曲率函数,如无正则化合页损失)的对数 regret,且无需预先调参。其主要贡献在于通过非单调、基于性能加权的学习率选择策略,在多种函数类型上实现快速收敛速率。

ABSTRACT

In online convex optimization it is well known that certain subclasses of objective functions are much easier than arbitrary convex functions. We are interested in designing adaptive methods that can automatically get fast rates in as many such subclasses as possible, without any manual tuning. Previous adaptive methods are able to interpolate between strongly convex and general convex functions. We present a new method, MetaGrad, that adapts to a much broader class of functions, including exp-concave and strongly convex functions, but also various types of stochastic and non-stochastic functions without any curvature. For instance, MetaGrad can achieve logarithmic regret on the unregularized hinge loss, even though it has no curvature, if the data come from a favourable probability distribution. MetaGrad's main feature is that it simultaneously considers multiple learning rates. Unlike previous methods with provable regret guarantees, however, its learning rates are not monotonically decreasing over time and are not tuned based on a theoretically derived bound on the regret. Instead, they are weighted directly proportional to their empirical performance on the data using a tilted exponential weights master algorithm.

研究动机与目标

  • 开发一种自适应在线学习方法,可自动在多种函数类别中实现快速 regret 速率,而无需手动调参。
  • 突破以往仅在强凸与一般凸函数之间插值的自适应方法的局限。
  • 在有利的数据分布下,处理无曲率函数(如无正则化合页损失)。
  • 设计一种非单调递减且不依赖理论 regret 边界的的学习率选择机制。
  • 提供一个统一框架,可同时适应多种函数类型,包括随机与非随机设置。

提出的方法

  • MetaGrad 维护一个主算法,该算法组合多个‘从属’模块,每个模块使用不同的学习率 η。
  • 每个从属模块执行基于其自身学习率 η 的在线梯度下降,根据梯度和参数更新跟踪代理损失。
  • 主算法使用倾斜指数权重,为在数据上表现更优的学习率分配更高权重。
  • 学习率从指数间隔的网格中选取,并采用重尾先验,以覆盖广泛的学习率范围。
  • 完整版本维护一个 d×d 协方差矩阵,而对角版本仅追踪对角元素以提升计算效率。
  • 通过结合主算法的 regret 与从属模块的代理 regret 边界,推导出复合 regret 边界,使其能自适应数据结构。

实验结果

研究问题

  • RQ1在有利数据分布下,能否设计一种在线学习算法,对无正则化合页损失(缺乏曲率)实现对数 regret?
  • RQ2能否设计一种自适应方法,同时在多种函数类别(包括指数凸、强凸及无曲率函数)中实现快速收敛速率?
  • RQ3能否设计一种非单调递减且不依赖理论 regret 边界的的学习率选择策略?
  • RQ4在扩展至更广泛函数类别时,适应性与计算成本之间的权衡是什么?
  • RQ5能否在不预先知晓函数类别的前提下,使 regret 边界对一般凸函数和更易处理的函数类型同时保持紧致?

主要发现

  • MetaGrad 实现了 O(√T ln ln T) 和 O(√(V^u_T d ln T) + d ln T) 的 regret 边界,其中 V^u_T 衡量了参数距离加权梯度的方差。
  • 在有利数据分布下,MetaGrad 在无正则化合页损失上实现了对数 regret O(ln T),尽管该函数缺乏曲率。
  • MetaGrad 的对角版本实现了 O(d ln(D²G²T)) 的 regret,与维度依赖的理论预期一致。
  • MetaGrad 的完整版本其 regret 边界依赖于累积梯度矩阵的秩,当数据表现出低维结构时可实现更快收敛速率。
  • 该方法对未知数据分布具有鲁棒性,因为 regret 边界对任意 u ∈ U 成立,并能自适应数据的内在难度。
  • 该算法在不依赖函数类别先验知识的前提下,保持了强大的理论保证,使其在各类在线学习任务中具有广泛适用性。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。