[论文解读] Improving Named Entity Recognition by External Context Retrieving and Cooperative Learning
本文提出一种方法,通过使用搜索引擎检索外部上下文文本并将其通过基于检索的视图整合到输入中,以增强命名实体识别(NER)性能。采用协同学习(Cooperative Learning)对原始视图与检索增强视图之间的表示和预测进行对齐,该方法在5个不同领域的8个NER数据集上达到最先进性能,即使在低资源或缺乏上下文的场景下也能显著提升准确率。
Recent advances in Named Entity Recognition (NER) show that document-level contexts can significantly improve model performance. In many application scenarios, however, such contexts are not available. In this paper, we propose to find external contexts of a sentence by retrieving and selecting a set of semantically relevant texts through a search engine, with the original sentence as the query. We find empirically that the contextual representations computed on the retrieval-based input view, constructed through the concatenation of a sentence and its external contexts, can achieve significantly improved performance compared to the original input view based only on the sentence. Furthermore, we can improve the model performance of both input views by Cooperative Learning, a training method that encourages the two input views to produce similar contextual representations or output label distributions. Experiments show that our approach can achieve new state-of-the-art performance on 8 NER data sets across 5 domains.
研究动机与目标
- 在缺乏文档级上下文的低上下文场景中提升NER模型性能。
- 利用搜索引擎中的外部知识,丰富输入表示以实现更好的命名实体消歧。
- 开发一个统一的训练框架,同时增强原始输入视图与基于检索的输入视图。
- 通过协同学习利用未标注数据实现半监督学习。
- 在多个领域内的多样化NER基准上超越现有最先进模型。
提出的方法
- 使用输入句子作为查询,从搜索引擎检索k篇相关文本。
- 使用BERTScore对检索到的文本进行重排序,选择语义最相关的l篇作为外部上下文。
- 通过将输入句子与前l篇检索到的文本拼接,构建基于检索的输入视图。
- 在原始输入视图(无外部上下文)和基于检索的输入视图上联合训练统一模型。
- 应用协同学习(CL),通过最小化两个视图之间token表示的L2距离或标签预测分布之间的KL散度来实现对齐。
- 采用基于Transformer的模型并添加CRF层进行序列标注,联合优化NLL损失和CL损失。
实验结果
研究问题
- RQ1当缺乏文档级上下文时,通过搜索引擎检索的外部上下文是否能显著提升NER性能?
- RQ2协同学习在对齐原始输入视图与基于检索的输入视图之间的预测和表示方面效果如何?
- RQ3所提出的方法是否能在多样化领域中泛化,并在多个NER基准上达到最先进性能?
- RQ4通过协同学习利用未标注数据是否能在半监督设置下进一步提升模型性能?
- RQ5重排序方法的选择(如BERTScore)如何影响检索到的上下文质量以及下游NER的准确率?
主要发现
- 与仅使用原始输入视图相比,将输入句子与语义相关的外部文本结合的基于检索的输入视图显著提升了NER性能。
- 采用L2距离或KL散度约束的协同学习能够同时提升原始输入视图与基于检索的输入视图的性能。
- 所提方法在涵盖5个不同领域(包括社交媒体、电子商务和新闻)的8个NER数据集上达到新的最先进水平。
- 该模型在缺乏文档级上下文的低上下文场景中表现出强大的泛化能力和鲁棒性。
- 通过协同学习利用未标注数据进行半监督训练可进一步提升性能,表明其具备良好的可扩展性和适应性。
- 基于BERTScore的重排序方法在选择高质量外部上下文方面优于其他评分函数,从而带来更优的上下文表示。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。