[论文解读] Learning an evolved mixture model for task-free continual learning
本文提出进化混合模型(EEM),一种无需任务标识的持续学习框架,通过希尔伯特-施密特独立性准则(HSIC)动态扩展其架构,以检测数据分布变化并触发专家添加。该方法结合基于变分自编码器(VAE)的专家与两种丢弃机制,以管理记忆并避免灾难性遗忘,在MNIST、CIFAR和ImageNet基准上实现了最先进性能,且无需任务边界。
Recently, continual learning (CL) has gained significant interest because it enables deep learning models to acquire new knowledge without forgetting previously learnt information. However, most existing works require knowing the task identities and boundaries, which is not realistic in a real context. In this paper, we address a more challenging and realistic setting in CL, namely the Task-Free Continual Learning (TFCL) in which a model is trained on non-stationary data streams with no explicit task information. To address TFCL, we introduce an evolved mixture model whose network architecture is dynamically expanded to adapt to the data distribution shift. We implement this expansion mechanism by evaluating the probability distance between the knowledge stored in each mixture model component and the current memory buffer using the Hilbert Schmidt Independence Criterion (HSIC). We further introduce two simple dropout mechanisms to selectively remove stored examples in order to avoid memory overload while preserving memory diversity. Empirical results demonstrate that the proposed approach achieves excellent performance.
研究动机与目标
- 为解决持续学习中缺乏任务标识或边界的问题,这是终身人工智能中更真实但研究不足的设定。
- 通过引入选择性样本丢弃机制,克服基于记忆的持续学习中的记忆过载与负向灾难性遗忘问题。
- 在不依赖任务标签的前提下,实现对数据分布变化的响应式动态模型扩展。
- 开发一种可扩展、无限容量的持续学习系统,以在非平稳数据流中保持知识。
- 证明HSIC作为无监督信号,在无类别标签条件下驱动混合模型扩展的有效性。
提出的方法
- 模型采用基于变分自编码器(VAE)的专家进行表征学习,结合分类器进行预测,形成动态集成架构。
- 提出一种新颖的扩展机制,通过评估每个专家知识与当前记忆缓冲区之间的HSIC,检测分布变化并触发新专家创建。
- 引入两种丢弃机制,选择性地从记忆缓冲区中移除存储样本,以防止过载并保持多样性。
- 扩展阈值由超参数λ控制,用于平衡模型复杂度与性能。
- 分类器每步使用10个样本的批次进行更新,且所有先前数据均不可访问,模拟实时流式处理环境。
- 该框架端到端训练,无任务边界,完全依赖HSIC驱动的扩展信号与记忆正则化。

实验结果
研究问题
- RQ1在无任务标签的情况下,持续学习模型能否根据数据分布变化动态扩展其容量?
- RQ2HSIC准则在无任务标签的设定下,作为触发模型扩展的无监督信号,其有效性如何?
- RQ3选择性记忆丢弃机制是否能有效防止记忆过载,同时保持知识多样性?
- RQ4所提出的进化混合模型是否在无任务持续学习中优于现有的动态扩展与基于记忆的方法?
- RQ5该模型在大规模、长尾数据流(如MINI-ImageNet)上是否具备良好的可扩展性?
主要发现
- 在Split MNIST上,EEM-SW达到96.79%准确率,优于CoPE(93.94%)与CNDPM(93.23%)。
- 在Split CIFAR10上,EEM-SW达到58.81%准确率,超过CoPE(48.92%)与CNDPM(45.21%)。
- 在Split CIFAR100上,EEM-SW达到22.33%准确率,优于CoPE(21.62%)与CNDPM(20.10%)。
- 在大规模Split MImageNet基准上,EEM-SW达到28.90%准确率,优于ER a(25.92%)与MIR(25.21%)。
- 消融实验表明,当HSIC阈值λ超过最优值后,尽管模型复杂度提高,准确率提升却趋于平缓。
- 所提出的丢弃机制有效缓解了记忆过载,同时在所有基准上保持了高性能。

更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。