[论文解读] SeqMix: Augmenting Active Sequence Labeling via Sequence Mixup
SeqMix 提出了一种用于主动序列标注的数据增强方法,通过在潜在空间中混合序列及其标记级别的标签,生成合理且带标签的序列,并使用判别器过滤低质量样本。该方法在命名实体识别(NER)和事件检测任务中,F1 分数平均提升 2.27%–3.75%,在低资源设置下提升更为显著。
Active learning is an important technique for low-resource sequence labeling tasks. However, current active sequence labeling methods use the queried samples alone in each iteration, which is an inefficient way of leveraging human annotations. We propose a simple but effective data augmentation method to improve the label efficiency of active sequence labeling. Our method, SeqMix, simply augments the queried samples by generating extra labeled sequences in each iteration. The key difficulty is to generate plausible sequences along with token-level labels. In SeqMix, we address this challenge by performing mixup for both sequences and token-level labels of the queried samples. Furthermore, we design a discriminator during sequence mixup, which judges whether the generated sequences are plausible or not. Our experiments on Named Entity Recognition and Event Detection tasks show that SeqMix can improve the standard active sequence labeling method by $2.27\%$--$3.75\%$ in terms of $F_1$ scores. The code and data for SeqMix can be found at https://github.com/rz-zhang/SeqMix
研究动机与目标
- 解决仅使用查询样本进行主动序列标注时效率低下、数据多样性受限和标注效率低下的问题。
- 克服在序列标注任务中生成语义合理且具有正确标记级别标签的序列的挑战。
- 通过在主动学习迭代过程中引入数据增强,提升低资源序列标注中的模型泛化能力和标签效率。
- 开发一种联合生成序列及其对应标签的方法,同时保持语义和句法的合理性。
- 实现与现有主动学习策略的集成,提升性能,而无需模型微调或架构修改。
提出的方法
- 通过插值两个采样序列及其对应标记级别标签的隐藏表示,在潜在空间中执行混合(mixup)。
- 通过潜在空间中的线性插值组合两个序列,生成增强后的序列和标签,保持结构和语义的一致性。
- 引入一个判别器,利用困惑度(perplexity)分数评估生成序列,以过滤掉不切实际或低质量的样本。
- 仅选择困惑度较低(即更合理)的序列纳入训练集,确保数据增强的质量。
- 将增强数据与原始查询样本一起整合到训练集中,从而在每次主动学习迭代中扩展标注数据集。
- 使用预训练语言模型提取潜在表示用于混合,实现有效且上下文相关的序列生成。
实验结果
研究问题
- RQ1在低资源设置下,结合联合标签生成的序列混合(sequence mixup)是否能提升主动序列标注的性能?
- RQ2基于判别器的过滤机制在数据增强过程中,对确保生成序列的合理性有多大的有效性?
- RQ3SeqMix 是否在不同序列标注任务和数据稀缺程度下,始终优于基线主动学习方法?
- RQ4与无增强的标准主动学习相比,SeqMix 在提升数据多样性和模型泛化能力方面有多大的增强作用?
- RQ5在潜在空间中进行混合与基于启发式或预训练模型的文本增强方法相比,在序列标注任务中表现如何?
主要发现
- 与标准主动学习基线相比,SeqMix 在 CoNLL-2003、ACE05 和 WebPage 数据集上平均提升 F1 分数 2.27%–3.75%。
- 在低资源场景下,SeqMix 在 WebPage 数据集上实现了高达 16.49% 的 F1 分数提升,表明在数据稀缺条件下具有显著优势。
- 基于判别器的过滤机制显著提升了生成序列的质量,表现为筛选出低困惑度样本。
- 消融实验证实,混合策略和判别器均对性能提升至关重要,且各自独立贡献。
- SeqMix 在不同数据使用百分比下均持续优于基线方法,尤其在低数据环境下提升最大。
- 该方法具有通用性,可兼容多种主动学习策略和序列标注任务,包括命名实体识别(NER)和事件检测。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。