[论文解读] Deep Active Learning for Sequence Labeling Based on Diversity and Uncertainty in Gradient
本文提出 W-BADGE,一种用于序列标注的新型主动学习方法,通过加权采样梯度嵌入结合不确定性与多样性。该方法基于序列长度优先选择信息量丰富、多样化且成本效益高的样本,在 NER 和槽填充任务中持续优于仅基于不确定性的基线与仅基于多样性的基线,在 ATIS 数据集上仅使用 15% 的训练数据即可实现接近完整模型性能的表现。
Recently, several studies have investigated active learning (AL) for natural language processing tasks to alleviate data dependency. However, for query selection, most of these studies mainly rely on uncertainty-based sampling, which generally does not exploit the structural information of the unlabeled data. This leads to a sampling bias in the batch active learning setting, which selects several samples at once. In this work, we demonstrate that the amount of labeled training data can be reduced using active learning when it incorporates both uncertainty and diversity in the sequence labeling task. We examined the effects of our sequence-based approach by selecting weighted diverse in the gradient embedding approach across multiple tasks, datasets, models, and consistently outperform classic uncertainty-based sampling and diversity-based sampling.
研究动机与目标
- 为解决 NER 和槽填充等序列标注任务中的数据效率挑战,这些任务需要昂贵的标记级别注释。
- 缓解仅基于不确定性的批量主动学习采样偏差,该方法倾向于选择冗余且相似的样本。
- 利用梯度嵌入将预测不确定性与结构多样性整合到未标注数据中,以改进查询选择。
- 通过基于序列长度加权样本选择,提升成本效益,优先选择更短、更便宜的标注序列。
- 在多个数据集、模型和序列标注任务上,对所提方法进行实证验证。
提出的方法
- 该方法从模型最后一层计算每个未标注序列的梯度嵌入,以捕捉预测不确定性和表示多样性。
- 应用 BADGE 算法通过在嵌入空间中最大化梯度嵌入之间的距离,选择一批具有多样性的样本。
- 提出一种新颖的加权方案,将样本选择概率与序列长度成反比,优先选择较短序列以降低标注成本。
- 通过选择在梯度空间中既具有高梯度范数(即不确定性高)又彼此几何距离较远的样本,实现不确定性和多样性的整合。
- 主动学习以迭代方式推进:每轮后使用新标注数据从头开始重新训练模型,确保不会对初始数据过拟合。
- 该方法在 CoNLL 2003(NER)、ATIS(槽填充)和 FMTOD(多语言任务导向)数据集上进行评估,采用 BiLSTM 和 BiLSTM 编码器-解码器架构。
实验结果
研究问题
- RQ1将不确定性与多样性整合到梯度嵌入中,是否能提升序列标注任务的主动学习性能?
- RQ2基于序列长度的加权采样是否能在不牺牲性能的前提下提升成本效益?
- RQ3所提方法在不同数据集和模型上与仅基于不确定性(如 BALD)和仅基于多样性(如 Coreset)的基线相比表现如何?
- RQ4主动学习在多大程度上能减少所需标注数据量,同时保持高 F1 性能?
- RQ5所提方法在不同序列标注架构和任务类型下是否具有鲁棒性?
主要发现
- W-BADGE 在所有数据集和模型上均持续优于仅基于不确定性的采样方法(如 MNLP、BALD)和仅基于多样性的采样方法(如 Coreset、BADGE)。
- 在 ATIS 数据集上,W-BADGE 仅使用 15% 的标注数据,即可达到完整数据集训练模型 98–99% 的 F1 分数。
- 在 CoNLL 2003 NER 任务中,W-BADGE 显著优于此前在该任务中保持最先进性能的 BALD 方法。
- W-BADGE 与基线之间的性能差距在训练初期最为显著,表明其具有更快的学习效率。
- W-BADGE 展现出强大的泛化能力,在 ATIS(槽填充)和 FMTOD(多语言)数据集上均表现良好,即使在不同模型架构下也表现稳定。
- 加权采样策略通过优先选择较短序列,有效降低了标注成本,在不降低性能的前提下显著提升了成本效益。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。