Skip to main content
QUICK REVIEW

[论文解读] Multi-task Representation Learning with Stochastic Linear Bandits

Leonardo Cella, Karim Lounici|arXiv (Cornell University)|Feb 21, 2022
Advanced Bandit Algorithms Research被引用 4
一句话总结

本文提出了一种针对多任务随机线性上下文Bandit问题的核范数正则化贪婪策略,该策略在无需事先知晓秩或可逆臂协方差矩阵的情况下,隐式学习跨任务的低秩共享表示。该方法实现了$ T\tilde{O}(\text{poly}(r)\text{poly}(d)\text{poly}(N)) $的遗憾界,该界在对数因子范围内为极小极大最优,并显著优于独立任务学习及先前方法如MLingreedy,尤其在$ T \geq d $时表现更优。

ABSTRACT

We study the problem of transfer-learning in the setting of stochastic linear bandit tasks. We consider that a low dimensional linear representation is shared across the tasks, and study the benefit of learning this representation in the multi-task learning setting. Following recent results to design stochastic bandit policies, we propose an efficient greedy policy based on trace norm regularization. It implicitly learns a low dimensional representation by encouraging the matrix formed by the task regression vectors to be of low rank. Unlike previous work in the literature, our policy does not need to know the rank of the underlying matrix. We derive an upper bound on the multi-task regret of our policy, which is, up to logarithmic factors, of order $\sqrt{NdT(T+d)r}$, where $T$ is the number of tasks, $r$ the rank, $d$ the number of variables and $N$ the number of rounds per task. We show the benefit of our strategy compared to the baseline $Td\sqrt{N}$ obtained by solving each task independently. We also provide a lower bound to the multi-task regret. Finally, we corroborate our theoretical findings with preliminary experiments on synthetic data.

研究动机与目标

  • 解决在任务间存在共享低维表示的随机线性上下文Bandit问题中的迁移学习挑战。
  • 开发一种无需事先知晓共享表示矩阵真实秩的策略。
  • 设计一种对非可逆臂协方差矩阵具有鲁棒性、且在小时间范围下仍有效的算法。
  • 实现与已知真实表示的Oracle策略相当的遗憾界。
  • 在高维或时间范围较短的设置下,优于现有基线方法如独立任务学习和MLingreedy。

提出的方法

  • 该方法采用基于核范数正则化的贪婪策略,以在任务特定回归向量矩阵中促进低秩结构。
  • 利用一种新颖的鞅集中不等式论证,在受限强凸性条件下推导出Oracle不等式。
  • 通过核范数正则化的经验风险最小化来估计共享表示,以促进低秩解。
  • 该算法自适应地学习潜在表示,无需预先指定秩。
  • 在最小假设下运行:对臂无有界性要求,也无需臂协方差矩阵可逆。
  • 该策略计算高效,且在每一步均无需求解复杂的矩阵分解问题。

实验结果

研究问题

  • RQ1能否设计一种多任务Bandit策略,使其遗憾界与已知真实低维表示的Oracle策略相当,而无需事先知晓秩?
  • RQ2核范数正则化如何提升具有共享表示的多任务线性Bandit中的学习效率?
  • RQ3任务数$ T $、维度$ d $和时间范围$ N $对联合学习策略的遗憾有何影响?
  • RQ4当秩被错误指定或臂协方差矩阵奇异时,所提策略与MLingreedy等现有方法相比表现如何?
  • RQ5该策略是否能在不假设臂协方差矩阵可逆或臂特征有界的情况下,实现极小极大最优遗憾?

主要发现

  • 所提策略实现了$ T\sqrt{rN} + \sqrt{rNTd} $的遗憾界(忽略对数因子),该界为极小极大最优。
  • 该遗憾界显著优于独立任务学习(其遗憾为$ T\sqrt{dN} $量级)。
  • 该策略在所有配置下均优于MLingreedy,尤其在$ d $较大或$ N $较小时表现更优。
  • 即使秩估计错误,MLingreedy的表现仍劣于所提方法,后者对秩的误设具有鲁棒性。
  • 核范数Bandit在所有情况下均优于ITL和MLingreedy,且当$ r \approx d $时甚至超越Oracle策略,原因在于持续的正则化优势。
  • 数值实验表明,该方法对维度和任务数量具有鲁棒性,在所有测试设置下均一致地优于基线方法。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。