Skip to main content
QUICK REVIEW

[论文解读] Probing Pre-trained Auto-regressive Language Models for Named Entity Typing and Recognition

Elena V. Epure, Romain Hennequin|arXiv (Cornell University)|Aug 26, 2021
Topic Modeling被引用 8
一句话总结

本文提出了一种新颖的探针方法,用于在不进行微调的情况下评估自回归语言模型(如 GPT-2)在零样本命名实体分类(NET)和少样本命名实体识别(NER)中的表现。通过利用元学习和一种新的记忆评估技术,研究发现 GPT-2 在常规和记忆化的实体上表现良好,其中名称不规则性作为有效线索,而上下文在少样本 NER 中的作用有限。

ABSTRACT

Despite impressive results of language models for named entity recognition (NER), their generalization to varied textual genres, a growing entity type set, and new entities remains a challenge. Collecting thousands of annotations in each new case for training or fine-tuning is expensive and time-consuming. In contrast, humans can easily identify named entities given some simple instructions. Inspired by this, we challenge the reliance on large datasets and study pre-trained language models for NER in a meta-learning setup. First, we test named entity typing (NET) in a zero-shot transfer scenario. Then, we perform NER by giving few examples at inference. We propose a method to select seen and rare / unseen names when having access only to the pre-trained model and report results on these groups. The results show: auto-regressive language models as meta-learners can perform NET and NER fairly well especially for regular or seen names; name irregularity when often present for a certain entity type can become an effective exploitable cue; names with words foreign to the model have the most negative impact on results; the model seems to rely more on name than context cues in few-shot NER.

研究动机与目标

  • 探究自回归语言模型(如 GPT-2)是否能在不进行微调的情况下有效泛化至命名实体分类和识别任务。
  • 设计一种受人类语言行为启发的探针设置,采用少样本和零样本上下文学习方法。
  • 开发并应用一种新方法,以评估预训练期间模型对命名实体的记忆情况。
  • 评估记忆化和上下文对模型在多样化命名实体识别与分类场景下性能的影响。
  • 提供一个更贴近人类泛化方式的现实测试框架,优于传统数据集划分方法。

提出的方法

  • 通过提供自然语言指令和实体类型定义,设计一种基于提示的零样本迁移策略,用于命名实体分类(NET)。
  • 将命名实体识别(NER)建模为机器阅读理解(MRC)任务,在推理时提供少量示例以引导模型。
  • 提出一种基于暴露度量的新记忆评估程序,用于在预训练期间将命名实体分类为记忆化或未记忆化。
  • 利用词级和转移级统计量的暴露阈值,从大规模语料库(如 DBpedia 和 CoNLL-2003)中识别记忆化和未记忆化的 NE。
  • 在多种数据集上评估性能,包括 CoNLL-2003、WNUT2017、MIT Movie 和 DBpedia,涵盖干净和嘈杂文本以及规则/不规则命名实体。
  • 对比记忆化与未记忆化 NE 的结果,并分析少样本 NER 中上下文线索的影响。

实验结果

研究问题

  • RQ1预训练的自回归语言模型(如 GPT-2)是否能在不进行微调的情况下,在零样本或少样本设置下有效执行命名实体分类和识别?
  • RQ2模型在预训练期间对命名实体的记忆化程度在面对未见或罕见实体时,如何影响其性能?
  • RQ3对于特定命名实体类型,名称不规则性在少样本 NER 中作为可靠线索的可靠程度如何?
  • RQ4当模型仅接收少量示例提示时,上下文线索在少样本 NER 中的影响力有多大?
  • RQ5在人类启发的测试条件下,模型对新型命名实体类型和嘈杂文本的泛化能力如何?

主要发现

  • GPT-2 在不进行任何微调的情况下,实现了强大的零样本命名实体分类(NET)性能,尤其在规则和记忆化实体上表现优异。
  • 在少样本 NER 中,GPT-2 表现具有竞争力,使用 16 个样本提示时,在 CoNLL-2003 上的平均 F1 分数为 0.75,在 MIT Movie 上为 0.62,在 WNUT2017 上为 0.61。
  • 特定命名实体类型中频繁出现的名称不规则性可作为有效可利用的线索,提升模型在少样本 NER 中的泛化能力。
  • 在少样本 NER 中,模型更依赖命名实体本身的身份,而非上下文线索,表明其上下文泛化能力有限。
  • 在预训练期间未出现的词汇构成的命名实体尤其具有挑战性,凸显了预训练暴露对模型泛化能力的重要性。
  • 所提出的记忆评估方法成功识别出(未)记忆化的命名实体,并揭示记忆化对 NET 和 NER 任务性能具有显著影响。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。