[论文解读] Adapting BERT for Continual Learning of a Sequence of Aspect Sentiment Classification Tasks
该论文提出了一种基于 BERT 的新型持续学习框架 B-CL,用于方面情感分析(ASC),通过基于胶囊网络的持续学习适配器(CLA)实现在防止灾难性遗忘的同时实现前向和后向知识迁移。通过利用动态路由提取共享知识,并使用特定任务的掩码实现知识隔离,B-CL 在 19 个 ASC 任务序列中,于新任务和旧任务上均显著优于所有基线模型,达到最先进性能。
This paper studies continual learning (CL) of a sequence of aspect sentiment classification (ASC) tasks. Although some CL techniques have been proposed for document sentiment classification, we are not aware of any CL work on ASC. A CL system that incrementally learns a sequence of ASC tasks should address the following two issues: (1) transfer knowledge learned from previous tasks to the new task to help it learn a better model, and (2) maintain the performance of the models for previous tasks so that they are not forgotten. This paper proposes a novel capsule network based model called B-CL to address these issues. B-CL markedly improves the ASC performance on both the new task and the old tasks via forward and backward knowledge transfer. The effectiveness of B-CL is demonstrated through extensive experiments.
研究动机与目标
- 为解决持续学习在方面情感分析(ASC)中的挑战,即模型必须在不遗忘先前知识的前提下学习一系列领域特定的情感分析任务。
- 实现在无旧训练数据访问的情况下,从先前任务向新任务进行前向知识迁移,以加速新任务的学习。
- 通过使用任务掩码隔离特定任务的知识,防止灾难性遗忘,同时保持对先前学习任务的性能。
- 提出一种新颖的持续学习适配器(CLA),将胶囊网络与动态路由整合进 BERT,以实现有效的知识迁移与保留。
- 证明仅微调 BERT 在持续学习中会失败,因其表示高度依赖特定任务,因此需要类似 B-CL 的新型架构。
提出的方法
- B-CL 采用基于胶囊网络与动态路由的持续学习适配器(CLA),用于识别并从先前任务向当前任务迁移共享知识。
- CLA 利用路由机制根据注意力头的相似性进行分组,实现从旧任务到新任务的相关知识选择性迁移。
- 引入特定任务模块(TSM)以隔离特定任务的表示,防止新任务学习过程中的干扰。
- 使用知识共享模块(KSM)聚合并跨任务传递共享知识,提升泛化能力与学习效率。
- 模型采用端到端训练,损失函数为多任务损失,平衡当前任务与先前任务的性能表现,同时使用任务掩码保护特定知识。
- B-CL 集成于预训练 BERT 主干网络,使其既能利用迁移学习优势,又能保持持续学习能力。
实验结果
研究问题
- RQ1基于 BERT 的模型能否有效从先前方面情感分析任务中迁移共享知识,以加速新任务的学习?
- RQ2在任务按顺序学习的场景下,持续学习框架能否防止在方面情感分析中的灾难性遗忘?
- RQ3在持续学习适配器中使用胶囊网络与动态路由,是否相比标准微调或正则化方法能提升知识迁移与保留效果?
- RQ4B-CL 在新任务与先前学习过的 ASC 任务上的性能,相较于现有持续学习基线方法(如 EWC、OWM、HAT)表现如何?
- RQ5所提出的架构在 19 个多样化 ASC 任务序列中,对前向与后向知识迁移的支持程度如何?
主要发现
- B-CL 在 19 个 ASC 任务上平均 Macro-F1 得分为 0.8140,显著优于次佳基线方法(OWM)的 0.7931。
- B-CL 的前向迁移性能(Macro-F1 为 0.7993)超过所有其他基线方法的前向迁移结果,表明其具备强大的知识迁移能力。
- 消融实验确认,知识共享模块(KSM)与特定任务模块(TSM)均不可或缺,因移除任一模块均导致 Macro-F1 下降超过 8%。
- 微调后的 BERT 与 Adapter-BERT 在持续学习场景下表现欠佳(WDF),Macro-F1 分别降至 0.4308 与 0.4481,归因于任务特定表示引发的灾难性遗忘。
- B-CL 的后向迁移使性能从 0.7993 略微提升至 0.8140 的 Macro-F1,表明持续训练进一步优化了模型的泛化能力。
- 结果表明,BERT 微调在持续学习中会因高度依赖特定任务的知识而失败,从而验证了类似 B-CL 这类新型架构的必要性。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。