Skip to main content
QUICK REVIEW

[论文解读] Parameter-free online learning via model selection

Dylan J. Foster, Satyen Kale|arXiv (Cornell University)|Dec 30, 2017
Advanced Bandit Algorithms Research参考文献 23被引用 11
一句话总结

本文提出了一种新颖且计算高效的元算法,用于通过模型选择实现无参数在线学习,在温和的光滑性假设下,可在任意巴拿赫空间中实现oracle不等式。通过利用带有随机播放的多尺度专家建议框架,该方法实现了对每个专家损失范围自适应的后悔边界,将先前结果从嵌套希尔伯特空间类推广至非线性及基于矩阵的假设集,并提供了强大的有限样本保证。

ABSTRACT

We introduce an efficient algorithmic framework for model selection in online learning, also known as parameter-free online learning. Departing from previous work, which has focused on highly structured function classes such as nested balls in Hilbert space, we propose a generic meta-algorithm framework that achieves online model selection oracle inequalities under minimal structural assumptions. We give the first computationally efficient parameter-free algorithms that work in arbitrary Banach spaces under mild smoothness assumptions; previous results applied only to Hilbert spaces. We further derive new oracle inequalities for matrix classes, non-nested convex sets, and $\mathbb{R}^{d}$ with generic regularizers. Finally, we generalize these results by providing oracle inequalities for arbitrary non-linear classes in the online supervised learning model. These results are all derived through a unified meta-algorithm scheme using a novel "multi-scale" algorithm for prediction with expert advice based on random playout, which may be of independent interest.

研究动机与目标

  • 开发一种通用且高效的在线学习模型选择框架,避免依赖于嵌套希尔伯特空间等特定结构假设。
  • 将无参数在线学习扩展至任意巴拿赫空间和非线性假设类,包括矩阵和高维设置。
  • 提供计算高效的算法,并具备有限样本oracle不等式,使其性能可与选择最佳假设类的oracle相媲美。
  • 通过一种新颖的多尺度预测-专家算法,统一并推广现有在线模型选择结果。

提出的方法

  • 提出一种元算法框架,通过带有随机播放的多尺度专家建议方案组合不同假设类的子算法。
  • 引入一种新颖的‘多尺度’预测专家建议算法,使其后悔值能自适应于每个专家的损失范围,确保对不同损失幅度的鲁棒性。
  • 使用专家上的先验分布来加权子算法,先验分布经调整以反映每个假设类的预期复杂度。
  • 将该框架应用于多种设置:巴拿赫空间中的嵌套线性类、非嵌套凸集、矩阵类(如正半定矩阵)以及通过正则化实现的非线性类。
  • 利用Fenchel共轭和对偶性推导后悔边界,通过˜ℓ(ˆy,y) = ℓ(ˆy,y) − ℓ(0,y)对损失进行中心化处理,以提升稳定性。
  • 采用子算法如矩阵指数梯度法和矩阵乘法权重法,其后悔边界按范数参数Rk和Lk进行缩放。

实验结果

研究问题

  • RQ1我们能否设计一种计算高效的在线模型选择算法,在无需依赖嵌套希尔伯特空间结构的前提下,实现在一般巴拿赫空间中的oracle不等式?
  • RQ2如何使学习算法的后悔值适应于每个假设类的实际损失范围,特别是在损失随类复杂度增长时?
  • RQ3所提出的框架能否扩展至非线性假设类和基于矩阵的学习问题,如在线主成分分析或矩阵预测?
  • RQ4专家先验分布在此框架中在实现跨多样化假设类的最优后悔边界中起到何种作用?
  • RQ5多尺度专家建议机制如何确保最终后悔值与最佳单个专家相当,即使各类损失显著不同?

主要发现

  • 所提框架在温和光滑性假设下,实现了任意巴拿赫空间中在线模型选择的oracle不等式,推广了先前局限于希尔伯特空间的成果。
  • 该算法为高维设置下的在线主成分分析和在线矩阵预测提供了首个多项式时间的无参数在线学习解决方案。
  • 对于核范数有界且为秩-k的正半定矩阵类,后悔边界被限制在Õ(√n min{k, d−k}²)以内,与oracle性能一致。
  • 在核范数约束的矩阵学习情况下,该框架对范数有界为R的类实现了O(R√n log d)的后悔边界,使用矩阵乘法权重法作为子算法。
  • 通过将每个专家的后悔值按其损失范围进行缩放,该方法确保最终后悔值始终在最佳假设类的常数倍之内,即使单个专家的损失无界或持续增长。
  • 理论保证通过统一的元算法框架实现,将每个假设类视为一个专家,多尺度结构确保对于任意给定的问题实例,总存在一个子算法,其后悔值在最优类的常数倍之内。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。