[论文解读] Zero-Shot Learning in Named-Entity Recognition with External Knowledge
本文提出 ZERO,一种零样本和少样本命名实体识别模型,利用预训练词嵌入(GloVe、ConceptNet Numberbatch)和 LUKE 的上下文表示,无需在目标领域进行微调即可对实体进行分类。在零样本学习中,其平均宏 F1 为 0.23,且在少样本设置下显著优于 LUKE,性能与源域和目标域之间的 KL 散度呈负相关。
A significant shortcoming of current state-of-the-art (SOTA) named-entity recognition (NER) systems is their lack of generalization to unseen domains, which poses a major problem since obtaining labeled data for NER in a new domain is expensive and time-consuming. We propose ZERO, a model that performs zero-shot and few-shot learning in NER to generalize to unseen domains by incorporating pre-existing knowledge in the form of semantic word embeddings. ZERO first obtains contextualized word representations of input sentences using the model LUKE, reduces their dimensionality, and compares them directly with the embeddings of the external knowledge, allowing ZERO to be trained to recognize unseen output entities. We find that ZERO performs well on unseen NER domains with an average macro F1 score of 0.23, outperforms LUKE in few-shot learning, and even achieves competitive scores on an in-domain comparison. The performance across source-target domain pairs is shown to be inversely correlated with the pairs' KL divergence.
研究动机与目标
- 为解决 NER 模型在未见领域中泛化能力差的问题,因标注成本过高而难以应用。
- 实现在目标领域无需标注数据情况下的零样本和少样本学习。
- 通过词嵌入整合外部语义知识,提升跨领域 NER 性能。
- 评估领域相似性(以 KL 散度衡量)对零样本迁移性能的影响。
- 为低资源或新领域提供一种实用的、无需微调的 NER 替代方案。
提出的方法
- 模型使用 LUKE 为输入标记和实体生成上下文表示。
- 通过与外部知识(GloVe 或 ConceptNet Numberbatch)中预训练的标签嵌入进行点积运算,将每个标记的表示映射到标签空间。
- 最终预测结果为与标记表示点积得分最高的标签。
- 在与外部嵌入比较前,对 LUKE 的输出表示进行降维处理。
- 通过源-目标领域迁移对之间的宏 F1 分数评估性能。
- 计算领域分布之间的 KL 散度,并与模型性能进行相关性分析,以评估可迁移性。
实验结果
研究问题
- RQ1一个 NER 模型是否能在没有任何标注训练样本的情况下,在未见领域中实现有竞争力的性能?
- RQ2外部知识(词嵌入)的整合在多大程度上提升了零样本和少样本 NER 的性能?
- RQ3以 KL 散度衡量的领域相似性,在多大程度上能预测零样本 NER 迁移的成功?
- RQ4在仅提供有限目标领域数据的少样本学习场景下,ZERO 与 LUKE 相比表现如何?
- RQ5该模型能否实现与监督基线(如 LUKE)相当的领域内性能?
主要发现
- 在未见领域的零样本学习中,ZERO 的平均宏 F1 得分为 0.2323,证明了无需标注数据即可实现可行的性能。
- 在少样本学习中,ZERO 显著优于 LUKE,仅使用每个实体一个标注样本时,其宏 F1 达到 0.5507,而 LUKE 仅为 0.0。
- 模型在跨领域迁移中的性能与源域和目标域之间的 KL 散度呈负相关,决定系数 R² 为 0.19。
- 在领域内评估中,ZERO 表现具有竞争力,仅在音乐领域略逊于 LUKE,在人工智能、文学和科学领域则表现相当。
- 该模型在少样本设置下展现出强大的泛化能力,当每个标签仅提供一个样本时,F1 分数相比零样本性能提升了 0.2766。
- 尽管结果令人鼓舞,但由于 F1 分数较低,该模型在患者病历去标识化等高风险应用中的表现仍受限。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。