Skip to main content
QUICK REVIEW

[论文解读] Uniform regret bounds over $R^d$ for the sequential linear regression problem with the square loss

Pierre Gaillard, Sébastien Gerchinovitz|arXiv (Cornell University)|Feb 16, 2018
Advanced Bandit Algorithms Research参考文献 4被引用 5
一句话总结

该论文提出了一种新颖的在线线性回归算法,在 $\mathbb{R}^d$ 上对平方损失实现了统一的遗憾界 $\sqrt{d}B^2 \ln T + O_T(1)$,优于先前最优的 $2\sqrt{d}B^2 \ln T$ 上界。该方法在非线性岭回归框架中采用数据相关的正则化,使 $\sqrt{d}B^2 \ln T$ 项前的常数达到最优值 1,适用于固定设计和逐步呈现特征的场景。

ABSTRACT

We consider the setting of online linear regression for arbitrary deterministic sequences, with the square loss. We are interested in the aim set by Bartlett et al. (2015): obtain regret bounds that hold uniformly over all competitor vectors. When the feature sequence is known at the beginning of the game, they provided closed-form regret bounds of $2d B^2 \\ln T + \\mathcal{O}_T(1)$, where $T$ is the number of rounds and $B$ is a bound on the observations. Instead, we derive bounds with an optimal constant of $1$ in front of the $d B^2 \\ln T$ term. In the case of sequentially revealed features, we also derive an asymptotic regret bound of $d B^2 \\ln T$ for any individual sequence of features and bounded observations. All our algorithms are variants of the online non-linear ridge regression forecaster, either with a data-dependent regularization or with almost no regularization.

研究动机与目标

  • 为 $\mathbb{R}^d$ 上的统一遗憾,弥合已知的 minimax 下界 $\sqrt{d}B^2 \ln T$ 与现有最佳上界 $2\sqrt{d}B^2 \ln T$ 之间的差距。
  • 设计一种遗憾最小化算法,使 $\sqrt{d}B^2 \ln T$ 项前的常数达到最优值 1,适用于固定设计和逐步呈现特征的场景。
  • 构建一种数据相关的正则化方案,实现在无需事先知晓观测值边界 $B$ 或时域 $T$ 的情况下实现最优遗憾,同时保持尺度不变性。
  • 将非线性岭回归预测器的适用范围扩展至特征逐步呈现的场景,克服先前向后计算方法的局限性。

提出的方法

  • 提出一种非线性岭回归预测器的变体,采用随特征向量经验协方差自适应的数据相关正则化参数。
  • 基于 Gram 矩阵 $G_t = X_t X_t^T$ 的特征结构,采用动态正则化策略,确保对预测方差的最优控制。
  • 应用 Moore-Penrose 广义逆处理秩不足的特征矩阵,并推导出预测规则的闭式表达式。
  • 采用基于特征值交错和矩阵扰动理论的新型分析技术,将遗憾界表示为逆 Gram 矩阵的迹。
  • 建立遗憾与 Gram 矩阵行列式之间的联系,利用恒等式 $\det(\Gamma) = \prod_{k=1}^r \lambda_k(B)$(其中 $\Gamma$ 为约化矩阵),推导出紧致的上界。
  • 证明该算法的遗憾被统一有界于 $\sqrt{d}B^2 \ln T + O_T(1)$,与 minimax 下界仅相差一个低阶项。

实验结果

研究问题

  • RQ1能否将在线线性回归中的统一遗憾从 $2\sqrt{d}B^2 \ln T$ 改进至 $\sqrt{d}B^2 \ln T$,并实现最优常数?
  • RQ2在无需向后计算或事先知晓 $T$ 的情况下,能否在逐步呈现特征的场景中实现这一最优遗憾界?
  • RQ3能否设计一种数据相关的正则化策略,在保持尺度不变性并避免对特征有界性假设的前提下,实现最优遗憾?
  • RQ4Gram 矩阵 $G_t$ 的特征结构如何影响遗憾?能否利用其特性推导出更紧致的上界?
  • RQ5能否将非线性岭回归框架适配至序列特征场景,在最小正则化下仍实现最优遗憾?

主要发现

  • 所提算法实现了 $\sqrt{d}B^2 \ln T + O_T(1)$ 的统一遗憾界,与 minimax 下界仅相差一个低阶项。
  • 在 $\sqrt{d}B^2 \ln T$ 项前的常数从 2 改进至 1,达到最优常数。
  • 该算法在固定设计和逐步呈现特征的场景中均适用,且具有相同的遗憾保证。
  • 该方法采用自适应于经验特征分布的数据相关正则化,无需事先知晓 $B$ 或 $T$。
  • 分析表明,遗憾由约化 Gram 矩阵 $\Gamma$ 的行列式紧密控制,其与特征协方差的特征值相关。
  • 该算法保持了尺度不变性,且可向前计算,即使在特征逐步呈现时亦成立,克服了先前向后算法的局限性。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。