[论文解读] Adaptive Name Entity Recognition under Highly Unbalanced Data
该论文提出了一种两阶段命名实体识别(NER)框架,通过RNN-CNN分类器将句子划分为弱类别和强类别实体,随后对低资源实体应用专门的Bi-LSTM-CRF模型以提升性能。与基线模型相比,该方法使罕见类别(如Nat、Art、Eve)的F1分数提升超过50%,在弱类别数据极少的情况下实现了0.67的宏平均F1分数。
For several purposes in Natural Language Processing (NLP), such as Information Extraction, Sentiment Analysis or Chatbot, Named Entity Recognition (NER) holds an important role as it helps to determine and categorize entities in text into predefined groups such as the names of persons, locations, quantities, organizations or percentages, etc. In this report, we present our experiments on a neural architecture composed of a Conditional Random Field (CRF) layer stacked on top of a Bi-directional LSTM (BI-LSTM) layer for solving NER tasks. Besides, we also employ a fusion input of embedding vectors (Glove, BERT), which are pre-trained on the huge corpus to boost the generalization capacity of the model. Unfortunately, due to the heavy unbalanced distribution cross-training data, both approaches just attained a bad performance on less training samples classes. To overcome this challenge, we introduce an add-on classification model to split sentences into two different sets: Weak and Strong classes and then designing a couple of Bi-LSTM-CRF models properly to optimize performance on each set. We evaluated our models on the test set and discovered that our method can improve performance for Weak classes significantly by using a very small data set (approximately 0.45\%) compared to the rest classes.
研究动机与目标
- 解决命名实体识别(NER)数据集中罕见类别(如Art、Eve、Nat)的训练样本远少于常见类别所带来的高度不平衡问题。
- 克服标准Bi-LSTM-CRF和基于BERT的模型在低资源实体类型上因类别不平衡导致的性能下降问题。
- 开发一种轻量级、自适应的分类模块,用于检测句子是否包含弱类别实体,从而实现针对性的模型优化。
- 在不依赖大规模数据收集的前提下,通过模型架构调整提升罕见实体类型的F1分数。
提出的方法
- 训练一个RNN-CNN分类器,以区分包含弱类别实体(Art、Eve、Nat)的句子与仅包含强类别实体(Geo、Tim、Org、Per、Gpe)的句子。
- 利用RNN-CNN的输出将句子路由至两个独立的Bi-LSTM-CRF模型:一个针对弱类别优化,另一个针对强类别优化。
- 使用预训练的GloVe和BERT嵌入作为输入特征,以增强所有实体类型的泛化能力。
- 在训练过程中应用加权损失函数,进一步缓解基础模型中的类别不平衡问题。
- 通过多个模型变体(Bi-LSTM-CRF、BERT-FeedForward及双模型)的多数投票机制,提升最终预测的鲁棒性。
- 集成两阶段推理流程:首先分类句子类型(弱/强),然后应用对应的NER模型。
实验结果
研究问题
- RQ1两阶段分类方法是否能提升在高度不平衡数据集中罕见实体类型的NER性能?
- RQ2将弱类别与强类别预测分离为独立的Bi-LSTM-CRF模型,相较于单一统一模型,效果如何?
- RQ3在仅使用极少额外数据的情况下,对低资源实体类型(如Nat、Art、Eve)的性能可提升至何种程度?
- RQ4将BERT嵌入与任务特定分类器结合,是否比标准Bi-LSTM-CRF在不平衡NER数据上表现更优?
- RQ5与标准模型相比,所提方法在宏平均F1分数上的表现如何,特别是在少数类上?
主要发现
- 所提方法将宏平均F1分数提升至0.67,显著高于基线Bi-LSTM-CRF模型的0.55以及BERT-FeedForward模型的0.64。
- 弱类别实体的F1分数提升超过50%:与基线Bi-LSTM-CRF相比,Nat从0.26提升至0.43,Art从0.00提升至0.10,Eve从0.17提升至0.24。
- BERT-FeedForward模型在全局F1(0.88)和加权F1(0.84)上表现最高,但因罕见类别处理能力不足,宏平均F1仍表现欠佳。
- RNN-CNN分类器在区分弱类别句子方面达到99.6%的准确率,有效支持了专用NER模型的路由机制。
- 该方法仅使用0.45%的训练数据分配给弱类别,即实现0.67的宏平均F1,展现出极高的数据效率。
- 尽管弱类别数据量极少,该方法在宏平均F1上仍显著优于所有基线模型,证明其在低资源场景下的有效性。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。