[论文解读] AdaptSum: Towards Low-Resource Domain Adaptation for Abstractive Summarization
本文提出了 AdaptSum,一个针对六种不同领域中低资源抽取式摘要任务的基准,并研究了三种第二阶段预训练策略——源领域预训练(SDPT)、领域自适应预训练(DAPT)和任务自适应预训练(TAPT)——在大型生成模型上的表现。研究发现,源领域预训练(SDPT)和任务自适应预训练(TAPT)能提升少样本学习性能,而领域自适应预训练(DAPT)仅在预训练数据与目标领域高度匹配时才有效。此外,研究还表明 RecAdam 能够缓解持续预训练过程中的灾难性遗忘,显著提升 TAPT 的性能。
State-of-the-art abstractive summarization models generally rely on extensive labeled data, which lowers their generalization ability on domains where such data are not available. In this paper, we present a study of domain adaptation for the abstractive summarization task across six diverse target domains in a low-resource setting. Specifically, we investigate the second phase of pre-training on large-scale generative models under three different settings: 1) source domain pre-training; 2) domain-adaptive pre-training; and 3) task-adaptive pre-training. Experiments show that the effectiveness of pre-training is correlated with the similarity between the pre-training data and the target domain task. Moreover, we find that continuing pre-training could lead to the pre-trained model's catastrophic forgetting, and a learning method with less forgetting can alleviate this issue. Furthermore, results illustrate that a huge gap still exists between the low-resource and high-resource settings, which highlights the need for more advanced domain adaptation methods for the abstractive summarization task.
研究动机与目标
- 为解决在多样化领域中缺乏用于抽取式摘要的低资源领域适应基准的问题。
- 在低资源设置下,调查第二阶段预训练策略(源领域、领域自适应和任务自适应预训练)的有效性。
- 检验领域自适应预训练是否能提升性能,以及其是否对预训练数据与目标任务数据之间的相似性敏感。
- 评估持续预训练过程中灾难性遗忘的影响,并使用 RecAdam 进行缓解。
- 突出低资源抽取式摘要中的关键挑战,并为未来研究提供指导。
提出的方法
- 通过整合六个现有数据集(对话、邮件、电影评论、辩论、社交媒体、科学)并减少训练样本数量,构建低资源基准以模拟低资源场景。
- 应用三种第二阶段预训练策略:在标注摘要数据集上进行源领域预训练(SDPT),在无标签领域特定文本上进行领域自适应预训练(DAPT),在小规模任务相关无标签文本上进行任务自适应预训练(TAPT)。
- 以 BART 作为基础生成模型,并在每个预训练阶段后进行微调,以完成抽取式摘要任务。
- 引入 RecAdam——一种参数高效且具备遗忘感知能力的优化方法——以减少持续预训练过程中的灾难性遗忘。
- 使用 ROUGE 分数(F1)进行评估,并在不同资源水平(50、2%、25%、100% 训练样本)下进行消融实验。
- 通过分析词汇重叠和数据统计信息,评估预训练领域与目标领域之间的相似性。
实验结果
研究问题
- RQ1在低资源抽取式摘要任务中,不同第二阶段预训练策略(SDPT、DAPT、TAPT)的有效性如何?
- RQ2预训练数据与目标领域数据之间的相似性是否会影响领域自适应预训练(DAPT)的性能?
- RQ3灾难性遗忘在持续预训练过程中对性能的损害程度如何?是否能够通过方法缓解?
- RQ4随着训练样本数量减少,性能如何变化,特别是在极端低资源场景(如仅 50 个样本)下?
- RQ5在将抽取式摘要模型适配到低资源领域时,面临的主要挑战是什么?
主要发现
- 基于 XSum 的源领域预训练(SDPT)优于基于 CNN/DM 的 SDPT,尤其在输入和摘要长度较短的领域中,原因在于 XSum 拥有更高的新词比例和更强的摘要泛化能力。
- 任务自适应预训练(TAPT)在低资源设置下始终优于微调,但在中等和高资源设置下因灾难性遗忘而性能下降。
- 领域自适应预训练(DAPT)仅在预训练语料与目标领域高度相似时才能提升性能;否则性能反而更差,这与分类任务中的发现相矛盾。
- RecAdam 有效缓解了 TAPT 中的灾难性遗忘,显著提升了性能,尤其在低资源场景下表现突出。
- 即使采用最优预训练策略,低资源与高资源设置之间仍存在显著性能差距,模型在仅 50 个训练样本时表现极差。
- 使用中等规模数据进行 DAPT 的性能接近高资源设置,表明大规模预训练与有效的第二阶段预训练可在一定程度上弥补数据稀缺问题。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。