Skip to main content
QUICK REVIEW

[论文解读] Evaluating Online Continual Learning with CALM

Germán Kruszewski, Ionut Sorodoc|arXiv (Cornell University)|Apr 7, 2020
Machine Learning and Algorithms参考文献 62被引用 7
一句话总结

本文提出了CALM,一种用于在线持续学习的类无关持续语言建模基准,其中文本流在语言或领域之间交替,且无显式任务边界。它提出了新的度量方法,通过损失尖峰来衡量灾难性遗忘,并引入了'可塑门控'——一种通过学习潜在相似性来改进专家混合模型的门控机制,显著减少遗忘并提升对分布偏移的适应能力。

ABSTRACT

Online Continual Learning (OCL) studies learning over a continuous data stream without observing any single example more than once, a setting that is closer to the experience of humans and systems that must learn "on-the-wild". Yet, commonly available benchmarks are far from these real-world conditions, because they explicitly signal different tasks, lack latent similarity structure or assume temporal independence between different examples. Here, we propose a new benchmark for OCL based on language modelling in which input alternates between different languages and domains without any explicit delimitation. Additionally, we propose new metrics to study catastrophic forgetting in this setting and evaluate multiple baseline models based on compositions of experts. Finally, we introduce a simple gating technique that learns the latent similarities between different inputs, improving the performance of a Products of Experts model.

研究动机与目标

  • 为解决自然语言处理中在线持续学习缺乏真实基准的问题,特别是那些具有时间依赖性、潜在相似性且无显式任务边界的场景。
  • 开发一种新的评估框架,更真实地反映人类在现实世界中持续学习的条件。
  • 提出度量方法,不仅通过准确率下降,还通过分布偏移期间损失尖峰的幅度来量化灾难性遗忘。
  • 在新设置下评估基线模型,并提出一种新颖的门控机制,以提升模型适应能力并减少遗忘。

提出的方法

  • 提出CALM,一种持续语言建模基准,包含两种变体:基于字符的(五种语言)和基于词的(四个领域),两者均无显式任务分隔。
  • 设计基于分布偏移期间损失尖峰大小的新度量方法,以量化在线设置下的灾难性遗忘。
  • 采用专家混合(PoE)架构,并引入可学习门控机制,以动态将输入路由至相关专家。
  • 提出'可塑门控'——一种简单的门控策略,通过学习输入类别之间的潜在相似性,提升模型适应能力并减少遗忘。
  • 利用门控机制的混合权重分析所学的相似性,并验证其反映底层语言结构。
  • 对门控向量进行层次聚类,以验证所学相似性是否与已知的语言家族一致。

实验结果

研究问题

  • RQ1如何设计一个真实可靠的自然语言在线持续学习基准,其无显式任务边界,并包含类别之间的潜在相似性?
  • RQ2当面对流式、类无关设置下的分布偏移时,现有模型在多大程度上遭受灾难性遗忘?
  • RQ3可学习门控机制是否能通过捕捉输入类别之间的潜在相似性,提升专家混合模型在在线持续学习中的性能?
  • RQ4所学的门控模式是否反映输入数据中已知的结构关系,例如语言家族?
  • RQ5不同的数据流配置(如多语言 vs. 多领域)在多大程度上影响知识迁移潜力与遗忘程度?

主要发现

  • 多语言基准由于语言间统计差异较大,限制了知识迁移;而多领域基准因具有更细微的相似性,实现了显著的知识迁移。
  • PoE+可塑门控模型在适应类别切换方面优于标准基线,通过有效将输入路由至相关专家,显著提升性能。
  • 损失尖峰分析表明,可塑门控显著降低了灾难性遗忘峰值的幅度,表明在分布偏移期间具有更好的稳定性。
  • 所学门控向量与已知语言家族高度相关——例如,西班牙语和法语表现出相似的模块使用模式,且层次聚类成功恢复了语言分组。
  • 门控权重接近零的模块受到保护,不易遗忘;甚至负权重的模块也可能通过编码负向训练信号而发挥双重作用。
  • 可塑门控机制实现了专家的双重用途,其中正负权重共同通过编码'应预测'和'不应预测'信号,提升模型鲁棒性。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。