Skip to main content
QUICK REVIEW

[论文解读] Regret Bounds for Lifelong Learning

Pierre Alquier, Mai, The Tien|arXiv (Cornell University)|Oct 27, 2016
Domain Adaptation and Few-Shot Learning被引用 4
一句话总结

该论文提出EWA-LL,一种元算法,用于持续学习,通过指数加权聚合(EWA)在连续处理的任务中优化数据表示。该方法建立了后悔边界,继承了任务内算法的性能保证,在一般和凸损失函数下,对有限预测器集合实现了更优的$O(1/m)$速率——优于先前的$O(1/\sqrt{m})$边界。

ABSTRACT

We consider the problem of transfer learning in an online setting. Different tasks are presented sequentially and processed by a within-task algorithm. We propose a lifelong learning strategy which refines the underlying data representation used by the within-task algorithm, thereby transferring information from one task to the next. We show that when the within-task algorithm comes with some regret bound, our strategy inherits this good property. Our bounds are in expectation for a general loss function, and uniform for a convex loss. We discuss applications to dictionary learning and finite set of predictors. In the latter case, we improve previous $O(1/\sqrt{m})$ bounds to $O(1/m)$ where $m$ is the per task sample size.

研究动机与目标

  • 提供对持续学习的理论分析,对任务内算法的假设尽可能少。
  • 设计一种元算法,通过优化共享数据表示来实现跨任务知识迁移。
  • 推导出继承任务内学习器统计特性的元算法的后悔边界。
  • 改进持续学习中的现有收敛速率,特别是针对有限预测器集合。
  • 通过在线到批量转换,将分析扩展至元学习设置。

提出的方法

  • 提出EWA-LL,一种元算法,在每个任务后使用指数加权聚合(EWA)维护并更新表示的先验分布。
  • 利用在线后悔分析,将元学习器的累积损失相对于理想预测器进行边界限定。
  • 应用在线到批量转换,推导元学习设置下的泛化风险边界。
  • 使用集中技术,在凸损失函数下推导一致的后悔边界。
  • 采用对表示和预测器的随机选择策略,确保元学习中的泛化性能。
  • 在两个关键应用中分析性能:字典学习和有限预测器集合。

实验结果

研究问题

  • RQ1能否设计一种适用于持续学习的元算法,使其继承任意任务内算法的后悔特性?
  • RQ2在一般和凸损失函数下,此类元算法的后悔边界可建立为何种形式?
  • RQ3与现有$O(1/\sqrt{m})$边界相比,该分析能否在小样本量下实现更优的收敛速率?
  • RQ4如何将在线持续学习框架适配至离线元学习设置?
  • RQ5能否为EWA-LL元算法推导出一致的高概率边界?

主要发现

  • EWA-LL元算法继承了任务内算法的后悔边界,确保在单个任务上表现良好的学习器在持续学习设置中也能表现良好。
  • 对于有限预测器集合,本文将先前的$O(1/\sqrt{m})$后悔边界改进为$O(1/m)$,其中$m$为每轮任务的样本量。
  • 一般后悔边界为$1/\sqrt{T} + 1/\sqrt{m}$量级,在特定情况下可进一步优化为$1/\sqrt{T} + 1/m$。
  • 在凸损失函数下建立了统一的后悔边界,将分析从期望值扩展至高概率保证。
  • 通过在线到批量转换,获得了元学习设置下的风险边界,表明该策略在新任务上具有良好的泛化能力。
  • 该框架适用于字典学习和核方法,且可扩展至深度神经网络及其他表示学习模型。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。