Skip to main content
QUICK REVIEW

[论文解读] DualHSIC: HSIC-Bottleneck and Alignment for Continual Learning

Zifeng Wang, Zheng Zhan|arXiv (Cornell University)|Apr 30, 2023
Domain Adaptation and Few-Shot Learning被引用 4
一句话总结

DualHSIC 是一种新颖的持续学习方法,通过引入两个基于 HSIC 的组件来增强基于回放的模型:用于回放的 HSIC-瓶颈(HBR)以减少任务间干扰,以及 HSIC 对齐(HA)以促进任务无关知识共享。该方法将最先进回放方法的性能提升了高达 7.6%,并将正则化增强基线模型的性能提升了高达 6.5%,尤其在小缓冲区设置下表现更优。

ABSTRACT

Rehearsal-based approaches are a mainstay of continual learning (CL). They mitigate the catastrophic forgetting problem by maintaining a small fixed-size buffer with a subset of data from past tasks. While most rehearsal-based approaches study how to effectively exploit the knowledge from the buffered past data, little attention is paid to the inter-task relationships with the critical task-specific and task-invariant knowledge. By appropriately leveraging inter-task relationships, we propose a novel CL method named DualHSIC to boost the performance of existing rehearsal-based methods in a simple yet effective way. DualHSIC consists of two complementary components that stem from the so-called Hilbert Schmidt independence criterion (HSIC): HSIC-Bottleneck for Rehearsal (HBR) lessens the inter-task interference and HSIC Alignment (HA) promotes task-invariant knowledge sharing. Extensive experiments show that DualHSIC can be seamlessly plugged into existing rehearsal-based methods for consistent performance improvements, and also outperforms recent state-of-the-art regularization-enhanced rehearsal methods. Source code will be released.

研究动机与目标

  • 通过改进基于回放方法的表征学习,解决持续学习中的灾难性遗忘问题。
  • 通过从缓冲数据中去除特定任务的噪声,减轻持续学习过程中的任务间干扰。
  • 通过鼓励模型学习跨任务的不变特征,增强知识迁移能力。
  • 提供一种通用、即插即用的解决方案,与现有回放框架兼容,无需架构重构。
  • 系统性地探索希尔伯特-施密特独立性准则(HSIC)在持续学习中用于表征解耦的应用。

提出的方法

  • DualHSIC 提出用于回放的 HSIC-瓶颈(HBR),通过 HSIC 最小化缓冲特征与特定任务标签之间的统计依赖性,以抑制当前任务特异性知识带来的干扰。
  • 采用 HSIC 对齐(HA),通过最大化当前任务与过去任务特征之间的统计依赖性,以促进共享的、任务无关表征的学习。
  • HBR 在网络中间激活层上使用多层损失,以增强对任务特异性干扰的抑制效果。
  • HA 使用单层损失并配合投影头,对齐跨任务的表征,促进正向知识迁移。
  • 该方法设计为可无缝集成到现有基于回放的框架中,仅需极少的架构修改。
  • 损失函数在训练过程中端到端优化,HBR 与 HA 共同提升过去与当前任务的表征质量。

实验结果

研究问题

  • RQ1基于 HSIC 的正则化是否能有效减少持续学习中的任务间干扰?
  • RQ2基于 HSIC 的对齐是否能改善序列任务间任务无关知识的共享?
  • RQ3当集成到现有基于回放的持续学习方法中时,DualHSIC 的表现如何?
  • RQ4在小缓冲区尺寸下,DualHSIC 是否能保持性能优势,此时数据效率至关重要?
  • RQ5HBR 和 HA 组件中,多层与单层 HSIC 损失的贡献分别是什么?

主要发现

  • DualHSIC 在多个基准上持续提升最先进回放方法的性能,最高达 7.6%,展现出强大的泛化能力。
  • 该方法优于更强的正则化增强型回放基线,性能提升最高达 6.5%,尤其在小缓冲区设置下表现突出。
  • HBR 显著减少了 t-SNE 可视化中类别的重叠,表明其能更好地随时间保留过去任务的表征。
  • 消融实验确认,HBR 和 HA 中的投影头与对称损失项对最优性能均至关重要。
  • 多层 HBR 通过更深层次的监督提升性能,而单层 HA 已足够且降低计算开销。
  • DualHSIC 即使在缓冲容量有限的情况下仍保持优异性能,表明其具有高度的数据效率。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。