[论文解读] Continual BERT: Continual Learning for Adaptive Extractive Summarization of COVID-19 Literature
本文提出 Continual BERT,一种基于 BERT 的新型架构,可实现对不断演化的新冠文献的在线、持续学习式抽取式摘要。通过使用两个 BERT 模型——活跃列(Active Column)与知识库(Knowledge Base)——并结合层间连接与弹性权重整合(elastic weight consolidation),该模型在适应新发表文献的同时,有效缓解灾难性遗忘,实现高 ROUGE 分数,并在真实科学文本上生成连贯、上下文相关的摘要。
The scientific community continues to publish an overwhelming amount of new research related to COVID-19 on a daily basis, leading to much literature without little to no attention. To aid the community in understanding the rapidly flowing array of COVID-19 literature, we propose a novel BERT architecture that provides a brief yet original summarization of lengthy papers. The model continually learns on new data in online fashion while minimizing catastrophic forgetting, thus fitting to the need of the community. Benchmark and manual examination of its performance show that the model provide a sound summary of new scientific literature.
研究动机与目标
- 为应对实时总结迅速增长的新冠科学文献的挑战。
- 开发一种 BERT 的持续学习框架,可在适应新时间序列数据的同时保留先前文献的知识。
- 实现保留原文的抽取式摘要,突出长而复杂的论文中的关键句子。
- 在对流式科学出版物进行在线微调过程中,最小化灾难性遗忘。
- 使用 ROUGE 和人工评估,在通用科学文献和特定领域新冠论文上评估性能。
提出的方法
- 该模型使用两个相同的 BERT-base 编码器:活跃列(AC)用于当前任务学习,知识库(KB)用于保存先前学习到的知识。
- AC 与 KB 之间的层间连接实现知识迁移,KB 的参数通过弹性权重整合(EWC)整合到 AC 中。
- 采用交替训练过程,交替进行进展(AC 微调)和压缩(KB 整合)阶段,以平衡新旧知识。
- 在 AC 上方堆叠一个小型两层 Transformer 编码器,用于对输入文本中的句子进行分类和摘要提取。
- 该模型将每个句子视为一个分类实例,前缀添加 [CLS] 标记,并使用交替词嵌入方案进行编码,以区分相邻句子。
- 训练采用线性学习率预热调度,使用 AdamW 优化器并加入权重衰减,结合温度缩放的知识蒸馏,以及超参数 λ=15 和 γ=0.99 的 EWC。
实验结果
研究问题
- RQ1基于 BERT 的模型能否在持续学习来自时间有序的新科学出版物流的同时,保持高摘要性能?
- RQ2当在顺序批次的新冠文献上微调时,该模型在防止灾难性遗忘方面的有效性如何?
- RQ3从 PubMed 中引入的历史医学知识是否能提升在更新、特定领域新冠论文上的性能?
- RQ4与标准微调基线相比,该模型在 ROUGE 指标和人工评估中的表现如何?
- RQ5层间连接与 EWC 机制在基于 BERT 的摘要系统中稳定持续学习方面发挥什么作用?
主要发现
- 在压缩(整合)阶段,模型的训练损失为 0.21;在进展阶段,损失为 2.15,表明在新旧知识之间实现了有效但具挑战性的平衡。
- 在 PubMed 论文中,Continual BERT 在 ROUGE 评估中优于基线模型,尤其得益于历史文献中频繁出现的医学术语(如 'hydroxychloroquine')。
- 人工评估确认,该模型能通过从文献中选择散布的关键句子,生成连贯且上下文相关的抽取式摘要。
- 该模型在特定领域、高技术含量的论文(如 PubMed)上表现强劲,优于在更通用科学文章(ScisummNet)上的表现。
- 进展阶段的困难被归因于早期非疫情时期文献与现代新冠研究之间在信息内容上的显著差异。
- 该模型的可扩展架构支持长期、频繁的更新,适用于对快速演化的科学文献进行实时摘要。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。