[论文解读] Domain-Specific NER via Retrieving Correlated Samples
本文提出了一种领域特定的命名实体识别(NER)方法,通过从领域内文本中检索并利用相关联的未标注样本,提升模型性能。该方法采用BM25检索与多实例交叉编码器来建模相关性,通过投票和联合编码方式改进实体类型预测,在中文地址和电子商务NER基准上取得当前最优结果,F1分数相比强基线最高提升1.11个百分点。
Successful Machine Learning based Named Entity Recognition models could fail on texts from some special domains, for instance, Chinese addresses and e-commerce titles, where requires adequate background knowledge. Such texts are also difficult for human annotators. In fact, we can obtain some potentially helpful information from correlated texts, which have some common entities, to help the text understanding. Then, one can easily reason out the correct answer by referencing correlated samples. In this paper, we suggest enhancing NER models with correlated samples. We draw correlated samples by the sparse BM25 retriever from large-scale in-domain unlabeled data. To explicitly simulate the human reasoning process, we perform a training-free entity type calibrating by majority voting. To capture correlation features in the training stage, we suggest to model correlated samples by the transformer-based multi-instance cross-encoder. Empirical results on datasets of the above two domains show the efficacy of our methods.
研究动机与目标
- 解决中文地址和电子商务标题等领域特定文本中因缺乏上下文背景而导致的命名实体识别性能差的问题。
- 克服标准NER模型将输入样本视为独立个体、在困难且模糊的案例上表现不佳的局限性。
- 利用同一领域中自然相关的未标注样本,为实体识别提供消歧义上下文。
- 提出一种无需训练的校准方法,通过检索样本的多数投票机制,优化预测的实体类型。
- 提出一种多实例交叉编码器,在训练过程中显式建模输入样本与检索样本之间的相关性。
提出的方法
- 使用基于Elasticsearch的稀疏BM25检索器,基于大规模领域内未标注文本中的词汇相似性,检索相关样本。
- 通过在输入样本与检索样本上并行推理,随后进行多数投票,实现实体类型校准,以解决模糊性问题。
- 训练一个基于Transformer的多实例交叉编码器,联合编码输入样本与检索样本,捕捉复杂的关联特征。
- 将交叉编码器集成到BiLSTM-CRF框架中,使用NEZHA作为上下文表征,实现相关模式的端到端学习。
- 利用交叉编码器同时关注输入文本与检索文本,使模型能够动态权衡相关上下文,提升预测效果。
- 通过在CRF解码前拼接检索文本,优化推理过程,减少冗余计算,提升推理速度。
实验结果
研究问题
- RQ1从领域内数据中检索相关未标注样本,是否能提升在模糊、领域特定文本上的NER性能?
- RQ2通过在检索样本上进行多数投票的无训练实体类型校准,是否能持续提升NER准确率?
- RQ3能够联合建模输入与检索样本的多实例交叉编码器,是否能捕捉比标准NER模型更丰富的关联特征?
- RQ4未标注检索语料库的规模与质量如何影响所提方法的性能?
- RQ5在使用检索增强NER方法时,性能提升与推理速度之间的权衡关系如何?
主要发现
- 所提方法在地址数据集开发集上达到93.89的SOTA F1分数,相比基线NEZHA-BiLSTM-CRF提升1.11个百分点。
- 实体投票方法相比基线F1提升0.58个百分点,证明了跨实例校准的有效性。
- 多实例交叉编码器在地址与电子商务数据集上均优于所有基线模型,包括NEZHA-BC等强模型。
- 性能提升在前10个检索样本时最为显著,表明超过此数量后收益递减。
- 交叉编码器方法推理速度仅比基线慢2倍,4,000个样本测试集的运行时间为38.41秒,具备实际部署可行性。
- 较小或质量较低的未标注语料库会导致相关检索样本减少,性能增益下降,凸显数据质量的重要性。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。