[论文解读] Adversarial Learning for Chinese NER from Crowd Annotations
该论文提出了一种基于噪声众包标注的中文命名实体识别(NER)对抗学习框架,利用共享的Bi-LSTM提取工人无关特征,同时使用私有Bi-LSTM学习标注者特定模式,在来自对话和电商领域的两个新中文NER数据集上实现了最先进性能,F1分数相比强基线最高提升2.38%。
To quickly obtain new labeled data, we can choose crowdsourcing as an alternative way at lower cost in a short time. But as an exchange, crowd annotations from non-experts may be of lower quality than those from experts. In this paper, we propose an approach to performing crowd annotation learning for Chinese Named Entity Recognition (NER) to make full use of the noisy sequence labels from multiple annotators. Inspired by adversarial learning, our approach uses a common Bi-LSTM and a private Bi-LSTM for representing annotator-generic and -specific information. The annotator-generic information is the common knowledge for entities easily mastered by the crowd. Finally, we build our Chinese NE tagger based on the LSTM-CRF model. In our experiments, we create two data sets for Chinese NER tasks from two domains. The experimental results show that our system achieves better scores than strong baseline systems.
研究动机与目标
- 为解决在低质量、噪声众包标注数据上训练有效中文NER模型的挑战。
- 降低众包标注中标注者差异性和标注噪声的负面影响。
- 提升在对话和电商等专家标注数据稀缺的低资源领域中的NER性能。
- 开发一种深度学习框架,从多位众包标注者中学习共性与标注者特定的模式。
- 证明对抗训练能够有效从噪声众包标签中提取工人无关表征。
提出的方法
- 使用共享Bi-LSTM学习在不同标注者间保持不变的标注者通用特征。
- 为每位标注者单独训练一个私有Bi-LSTM,以建模其特定的标注行为。
- 在众包标注的NER标签序列上训练一个标签Bi-LSTM,以表示标注者群体的倾向。
- 训练一个工人判别器,用于区分共享Bi-LSTM特征与标签Bi-LSTM特征,促使共享特征趋于工人无关。
- 通过对抗训练联合优化共享Bi-LSTM,使其在最大化判别器损失的同时最小化NER损失。
- 最终的NER模型将共享Bi-LSTM特征与CRF层结合,形成LSTM-CRF架构。
实验结果
研究问题
- RQ1对抗训练能否有效从中文NER的噪声众包标注中提取工人无关特征?
- RQ2当在众包标注数据上训练时,所提出的模型与多数投票法和标准NER模型相比表现如何?
- RQ3该模型在专家标注数据有限的对话和电商等跨领域场景中,其泛化能力如何?
- RQ4在所提出的对抗性众包标注学习框架中,使用预训练字符嵌入是否能提升性能?
- RQ5在未经多数投票处理的原始众包标注数据上训练时,该模型能否超越如LSTM-CRF和CRF等强基线模型?
主要发现
- 在EC-UQ数据集上,所提出的ALCrowd模型相比强基线LSTM-CRF的F1分数提升了2.38%。
- 在DL-PS数据集上,ALCrowd相比LSTM-CRF的F1分数提升了1.08分,表明在不同领域中均具有一致的性能增益。
- 该模型在所有基线中均以统计显著性(p < 10^-5)表现最优,证实了对抗特征学习的有效性。
- 预训练字符嵌入显著提升性能,优于使用随机初始化嵌入的模型。
- 多数投票导致性能下降,尤其在语义模糊的句子中,因损失了具有信息量的标注差异。
- 案例研究显示,ALCrowd能正确识别出LSTM-CRF和多数投票系统均遗漏的命名实体(如'Xiexie')。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。