Skip to main content
QUICK REVIEW

[论文解读] Bayesian Optimized Continual Learning with Attention Mechanism

Ju Xu, Jin Ma|arXiv (Cornell University)|May 10, 2019
Domain Adaptation and Few-Shot Learning参考文献 15被引用 6
一句话总结

该论文提出BOCL,一种持续学习框架,通过贝叶斯优化动态确定每项任务的最优网络架构扩展,同时利用注意力机制选择性地利用先验知识。BOCL在显著降低模型复杂度和训练时间的前提下,实现了最先进性能,在防止灾难性遗忘并提升MNIST和CIFAR-100上的准确率方面优于PGN、DEN和RCL等方法。

ABSTRACT

Though neural networks have achieved much progress in various applications, it is still highly challenging for them to learn from a continuous stream of tasks without forgetting. Continual learning, a new learning paradigm, aims to solve this issue. In this work, we propose a new model for continual learning, called Bayesian Optimized Continual Learning with Attention Mechanism (BOCL) that dynamically expands the network capacity upon the arrival of new tasks by Bayesian optimization and selectively utilizes previous knowledge (e.g. feature maps of previous tasks) via attention mechanism. Our experiments on variants of MNIST and CIFAR-100 demonstrate that our methods outperform the state-of-the-art in preventing catastrophic forgetting and fitting new tasks better.

研究动机与目标

  • 解决持续学习中灾难性遗忘的挑战,即模型在学习新任务时性能在旧任务上下降的问题。
  • 克服固定架构方法依赖正则化而带来的局限性,避免新旧任务性能之间的权衡。
  • 在提升可扩展架构方法(如PGN、DEN和RCL)的基础上,降低模型复杂度和训练时间,同时保持或提升性能。
  • 开发一种方法,通过注意力机制智能选择与新任务相关的先验知识,避免无关特征带来的干扰。
  • 通过贝叶斯优化优化网络扩展决策,最小化冗余参数,并加速最优架构的搜索。

提出的方法

  • 使用贝叶斯优化解决在新任务到达时,确定每层应添加的滤波器或节点数量的组合优化问题。
  • 利用先前任务的知识对贝叶斯优化过程进行热启动,以加速收敛并减少试验次数。
  • 集成注意力机制,学习先前任务特征图对当前任务的重要性,实现选择性且高效的知识迁移。
  • 通过训练过程中更新的可学习注意力权重实现注意力机制,支持对相关先验知识的动态优先排序。
  • 将注意力加权的先前特征与新任务特征在统一网络中结合,保留任务特定表示的同时最小化干扰。
  • 在贝叶斯优化中使用高斯过程代理模型,以最少的评估次数高效探索可能的网络扩展搜索空间。

实验结果

研究问题

  • RQ1贝叶斯优化能否有效且高效地确定持续学习中每项新任务的最优网络扩展(滤波器/单元数量)?
  • RQ2注意力机制在选择性利用相关先验知识的同时减少无关特征干扰方面,能在多大程度上提升性能?
  • RQ3与现有持续学习方法(如PGN、DEN和RCL)相比,BOCL在模型复杂度、训练时间和准确率方面表现如何?
  • RQ4贝叶斯优化与注意力机制的结合是否能在多任务设置下实现更好的泛化能力并减少灾难性遗忘?
  • RQ5BOCL的性能对超参数选择的敏感程度如何?其在不同配置下是否仍保持优势?

主要发现

  • 在CIFAR-100上,BOCL相比DEN将模型参数减少了高达60%,相比PGN减少了52%,显示出显著的效率提升。
  • 在MNIST排列任务上,BOCL相比RCL将训练时间减少了49%,相比DEN减少了39%,表现出更快的收敛速度。
  • 注意力机制在CIFAR-100上将测试准确率提升了2.2%,在MNIST混合任务上提升了0.16%,在MNIST排列任务上提升了0.1%,在更复杂的数据集上增益最大。
  • 在相同参数量下,BOCL的测试准确率高于RCL、DEN和PGN,表明其具有更高的参数效率。
  • 在架构搜索中,BOCL优于随机搜索和强化学习,达到相当准确率所需试验次数显著更少。
  • 在所有评估基准上,BOCL完全防止了灾难性遗忘,即使在学习大量后续任务后,仍能保持对首个任务的高准确率。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。