[论文解读] Unsupervised Domain Adaptation of Contextualized Embeddings for Sequence Labeling
本文提出领域自适应微调方法,无需目标领域标注数据,即可将像 BERT 这类预训练上下文嵌入模型适应到分布外的领域任务中。通过在无标注的目标领域文本上使用掩码语言建模对 BERT 进行微调,该方法在早期现代英语和 Twitter 的序列标注任务中取得了显著改进,尤其在 OOV(词汇表外)词汇上表现突出,优于强大的 BERT 基线模型,且避免了灾难性遗忘。
Contextualized word embeddings such as ELMo and BERT provide a foundation for strong performance across a wide range of natural language processing tasks by pretraining on large corpora of unlabeled text. However, the applicability of this approach is unknown when the target domain varies substantially from the pretraining corpus. We are specifically interested in the scenario in which labeled data is available in only a canonical source domain such as newstext, and the target domain is distinct from both the labeled and pretraining texts. To address this scenario, we propose domain-adaptive fine-tuning, in which the contextualized embeddings are adapted by masked language modeling on text from the target domain. We test this approach on sequence labeling in two challenging domains: Early Modern English and Twitter. Both domains differ substantially from existing pretraining corpora, and domain-adaptive fine-tuning yields substantial improvements over strong BERT baselines, with particularly impressive results on out-of-vocabulary words. We conclude that domain-adaptive fine-tuning offers a simple and effective approach for the unsupervised adaptation of sequence labeling to difficult new domains.
研究动机与目标
- 为解决将预训练上下文嵌入模型应用于与预训练分布显著不同的领域(如历史文本或社交媒体文本)的挑战。
- 探究当仅在源领域(如新闻文本)有标注数据时,无监督领域自适应是否能提升序列标注性能。
- 评估在无标注目标领域文本上进行领域自适应微调,是否能在不降低源领域性能的前提下,提升对词汇表外词汇的性能。
- 对比无监督领域自适应微调与有监督微调的有效性,后者存在灾难性遗忘的风险。
提出的方法
- 提出领域自适应微调:使用掩码语言建模目标,在无标注目标领域文本上对 BERT 进行微调。
- 将该方法应用于两个具有挑战性的领域:早期现代英语和 Twitter,二者均与标准预训练语料有显著差异。
- 以在源领域标注数据上微调过的相同 BERT 模型为起点,进一步在无标注目标领域文本上进行适应。
- 采用 WordPiece 分词方法处理罕见词和词汇表外词,提升在低资源领域中的鲁棒性。
- 通过在适应阶段不使用目标领域的标注数据,避免灾难性遗忘,从而保持在源领域的性能。
- 在词性标注和命名实体识别任务上评估性能,与强大的 BERT 基线模型及先前的无监督领域自适应方法进行比较。
实验结果
研究问题
- RQ1无监督领域自适应微调是否能在无目标领域标注数据的情况下,提升对早期现代英语和 Twitter 等分布外文本的序列标注性能?
- RQ2与有监督微调相比,领域自适应微调在源领域上的性能退化程度如何?
- RQ3领域自适应微调是否能在低资源领域中对词汇表外词汇带来显著性能提升?
- RQ4在不同类型的领域偏移(如历时性变化(历史文本)和风格性变化(社交媒体))下,领域自适应微调的性能增益是否具有一致性?
- RQ5是否可以通过无监督微调,使单个 BERT 模型有效适应多个领域,而不会引发灾难性遗忘?
主要发现
- 在早期现代英语中,领域自适应微调使词汇表外词汇的错误率降低超过 50%,显著优于强大的 BERT 基线模型。
- 该方法在 Twitter 的命名实体识别任务中表现更优,优于 2016 年 WNUT 共享任务中的大多数系统。
- 与有监督微调(导致灾难性遗忘,降低源领域性能)不同,领域自适应微调在源领域和目标领域均保持了强劲的性能。
- 基于 BERT 的标注器在无需任何显式适应步骤的情况下,优于 Yang 和 Eisenstein(2016)提出的最先进无监督领域自适应方法。
- 该方法在多种领域偏移下均表现有效,包括历时性变化(历史英语)和风格性变化(社交媒体),展现出广泛的适用性。
- 结果表明,无监督领域自适应微调使单个模型能够泛化到多个领域,为 NLP 中的持续学习提供了有前景的路径。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。