Skip to main content
QUICK REVIEW

[论文解读] DAGA: Data Augmentation with a Generation Approach for Low-resource Tagging Tasks

Bosheng Ding, Linlin Liu|arXiv (Cornell University)|Nov 3, 2020
Topic Modeling参考文献 44被引用 6
一句话总结

本文提出DAGA,一种针对低资源序列标注任务的数据增强方法,利用在线性化标注句子上训练的语言模型生成高质量合成数据。通过在生成过程中联合建模词-标签对,DAGA生成多样化、上下文丰富的训练样本,从而提升模型泛化能力,在监督和半监督设置下,于命名实体识别(NER)、词性标注(POS tagging)和情感分析任务中持续优于基线模型,尤其在标注数据有限时表现更优。

ABSTRACT

Data augmentation techniques have been widely used to improve machine learning performance as they enhance the generalization capability of models. In this work, to generate high quality synthetic data for low-resource tagging tasks, we propose a novel augmentation method with language models trained on the linearized labeled sentences. Our method is applicable to both supervised and semi-supervised settings. For the supervised settings, we conduct extensive experiments on named entity recognition (NER), part of speech (POS) tagging and end-to-end target based sentiment analysis (E2E-TBSA) tasks. For the semi-supervised settings, we evaluate our method on the NER task under the conditions of given unlabeled data only and unlabeled data plus a knowledge base. The results show that our method can consistently outperform the baselines, particularly when the given gold training data are less.

研究动机与目标

  • 为解决序列标注任务中,特别是在低资源环境下标注训练数据有限的挑战。
  • 开发一种无需依赖外部资源(如WordNet或大型预训练模型)即可生成高质量合成数据的数据增强方法。
  • 通过语言模型生成多样化、上下文多样的训练样本,提升模型的鲁棒性和泛化能力。
  • 通过将未标注数据和知识库整合到生成过程中,实现有效的半监督学习。
  • 建立一种新的NLP数据增强范式,从零开始生成细粒度的、基于token的标签,而非修改已有数据。

提出的方法

  • 通过将每个词与其对应标签连接(例如,"B-PER Jose")对标注句子进行线性化,形成适合语言建模的序列。
  • 在这些线性化序列上训练一个单层循环语言模型,以学习词-标签联合生成模式。
  • 通过从训练好的语言模型中采样生成合成数据,确保选择高概率的标签-词对,以保持标签一致性。
  • 通过将生成过程条件化于未标注句子或知识库条目,将该方法扩展到半监督设置,有效利用辅助数据。
  • 在有外部知识(如实体类型、地理位置)时,使用条件生成,以提升实体多样性与真实性。
  • 应用数据过采样和模型微调以提升性能,尤其在真实数据稀缺时效果显著。

实验结果

研究问题

  • RQ1在对线性化标注句子进行训练的语言模型,能否生成提升低资源序列标注任务性能的合成数据?
  • RQ2与同义词替换或弱标签等现有数据增强方法相比,DAGA的基于生成的方法在鲁棒性和性能方面表现如何?
  • RQ3在半监督设置下,DAGA在多大程度上能利用未标注数据或知识库来增强模型泛化能力?
  • RQ4生成的上下文化实体的多样性是否与序列标注模型的性能提升相关?
  • RQ5在真实训练数据量变化时,DAGA的性能如何变化,特别是在低资源场景下?

主要发现

  • DAGA在多个序列标注任务(包括NER、POS标注和E2E-TBSA)中持续优于强基线模型,尤其在真实训练数据有限时表现更优。
  • 在监督设置下,DAGA在仅使用2,000条真实句子时,F1值显著提升——在E2E-TBSA上最高提升+4.2 F1点,在NER上提升+2.8 F1点。
  • 当使用知识库时,DAGA方法(gen kb)在真实数据量超过2,000时优于基线方法(kb),表明其对来自外部知识的噪声具有鲁棒性。
  • 该方法生成了大量新的上下文化实体(CEs),新CE与真实CE的比例与F1提升正相关,表明模型泛化能力得到增强。
  • DAGA生成的合成数据引入了有意义的多样性,例如新颖的姓名-地点组合(如"Sandrine Nixon"或"Bank of Alabama"),减少了记忆化和过拟合。
  • 利用未标注数据使模型能够生成真实数据或知识库中均未出现的现实实体,表明其能有效从原始文本中提取信息。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。