[论文解读] Multi-Stage Pre-training for Low-Resource Domain Adaptation
本文提出了一种用于低资源领域适应的多阶段预训练方法,通过扩展 RoBERTa-large 的词汇表以包含领域特定术语,并从无标注结构化数据中创建合成预训练任务,从而提升模型性能。该方法通过利用领域特定词汇和源自数据固有结构的辅助任务,在抽取式阅读理解任务上实现最高 2.8 的 F1 分数提升,在文档排序任务上实现 2.9 的 Match@1 提升,显著提高了性能。
Transfer learning techniques are particularly useful in NLP tasks where a sizable amount of high-quality annotated data is difficult to obtain. Current approaches directly adapt a pre-trained language model (LM) on in-domain text before fine-tuning to downstream tasks. We show that extending the vocabulary of the LM with domain-specific terms leads to further gains. To a bigger effect, we utilize structure in the unlabeled data to create auxiliary synthetic tasks, which helps the LM transfer to downstream tasks. We apply these approaches incrementally on a pre-trained Roberta-large LM and show considerable performance gain on three tasks in the IT domain: Extractive Reading Comprehension, Document Ranking and Duplicate Question Detection.
研究动机与目标
- 解决 NLP 中低资源领域适应的挑战,特别是在标注数据稀缺且预训练语言模型中缺乏领域特定术语的情况下。
- 通过在预训练模型中添加领域内术语,缓解 IT 等专业领域中的未登录词(OOV)问题。
- 利用无标注领域数据中的隐式结构(如问答对、模板化文档)构建辅助性合成预训练任务。
- 通过渐进式适应提升低资源任务(如抽取式阅读理解、文档排序、重复问题检测)的下游性能。
- 证明结合词汇扩展、合成预训练和数据增强的方法相较于标准微调可实现持续且显著的性能提升。
提出的方法
- 通过从无标注 IT 领域文本(如 Technotes 和 AskUbuntu 帖子)中提取的 10,000 个领域特定子词标记,扩展 RoBERTa-large 的词汇表。
- 通过利用结构化模式构建合成预训练数据:对于 TechQA,从问题-文档集合中生成正负样本文档对;对于 AskUbuntu,使用已知为重复问题的问答对。
- 使用掩码语言建模在合成数据上对适配后的 RoBERTa 模型进行预训练,使模型在无标注样本的情况下学习任务相关的表征。
- 通过应用词元删除、查询截断、停用词移除和标题省略等扰动,将极低资源的 TechQA 数据集训练集规模扩大十倍,实现数据增强。
- 使用标准交叉熵损失在下游任务上微调最终模型,并通过 F1、HA_F1、Match@1 和 MAP 等标准指标进行评估。
- 采用多阶段训练流程:首先扩展词汇表,然后在合成数据上预训练,最后在标注数据上微调;其中数据增强仅在 TechQA 设置中应用。
实验结果
研究问题
- RQ1将预训练语言模型的词汇表扩展为包含领域特定术语,是否能提升其在低资源下游 NLP 任务上的性能?
- RQ2能否从无标注、结构化的领域数据(如问答对或文档模板)中构建的合成预训练任务,提升迁移学习性能?
- RQ3在极低资源设置(如仅 600 个训练样本的 TechQA)中,通过简单扰动实现的数据增强效果如何?
- RQ4词汇扩展、合成预训练与数据增强三者结合,相较于标准微调在 RoBERTa-large 上的性能提升程度如何?
- RQ5在 IT 领域的抽取式阅读理解、文档排序和重复问题检测任务中,该适配模型的性能与强基线模型相比如何?
主要发现
- 将 RoBERTa-large 的词汇表扩展 10,000 个领域特定子词标记后,在 TechQA 抽取式阅读理解任务上 HA_F1 提升了 1.7 分。
- 在 RC 风格数据(正负样本文档对)上进行合成预训练,在 TechQA-RC 任务上实现了 HA_F1 提升 2.8 分,F1 提升 0.5 分。
- 在 TechQA-RC 任务中,数据增强使 HA_F1 和 F1 均提升约 1 分,证明其在极低资源场景下的有效性。
- 在 TechQA-DR 文档排序任务中,合成预训练使 Match@1 相较于标准语言建模提升 2.9 分,表明辅助任务具有强大的迁移能力。
- 在 AskUbuntu-DQD 任务中,最终模型在所有指标上均优于 RoBERTa-large 基线,其中最大相对提升(超过 10%)来自合成预训练。
- 词汇扩展、合成预训练与数据增强三者结合的方法在所有三项任务中均取得最佳结果,显著优于标准微调。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。