Skip to main content
QUICK REVIEW

[论文解读] NuNER: Entity Recognition Encoder Pre-training via LLM-Annotated Data

Sergei Bogdanov, Alexandre Constantin|arXiv (Cornell University)|Feb 23, 2024
Data Quality and ManagementDecision Sciences被引用 3
一句话总结

本文提出 NuNER,一种针对命名实体识别(NER)任务的特定领域基础模型,通过在由 C4 衍生的 2440 万词、LLM 标注的数据集上微调 RoBERTa 训练而成。NuNER 在类似规模模型中实现了最先进(SOTA)的 few-shot 性能,优于其基础模型及更大模型如 NER-BERT,同时在参数量仅为 GPT-4 的 1/56 的情况下,性能可与后者媲美。

ABSTRACT

Large Language Models (LLMs) have shown impressive abilities in data annotation, opening the way for new approaches to solve classic NLP problems. In this paper, we show how to use LLMs to create NuNER, a compact language representation model specialized in the Named Entity Recognition (NER) task. NuNER can be fine-tuned to solve downstream NER problems in a data-efficient way, outperforming similar-sized foundation models in the few-shot regime and competing with much larger LLMs. We find that the size and entity-type diversity of the pre-training dataset are key to achieving good performance. We view NuNER as a member of the broader family of task-specific foundation models, recently unlocked by LLMs.

研究动机与目标

  • 开发一种数据高效、任务特定的基础模型,用于命名实体识别(NER),以减少对昂贵人工标注数据的依赖。
  • 探究 LLM 标注的数据是否能有效用于预训练紧凑的编码器模型,以支持下游 NER 任务。
  • 评估所得到模型 NuNER 在 few-shot 和 zero-shot 设置下的性能,与大型语言模型及现有 NER 特定模型进行比较。
  • 识别影响此类任务特定基础模型性能的关键因素,尤其是数据集规模和实体类型多样性。

提出的方法

  • 使用 GPT-3.5 对 C4 数据集的一个子集(2440 万个词)进行标注,生成涵盖 20 万个唯一概念的实体标注。
  • 采用对比学习目标,在 LLM 标注的数据集上微调 RoBERTa-base 模型,以提升表征学习能力。
  • 通过 few-shot 和 zero-shot 协议,在多个 NER 基准测试集上微调下游分类头。
  • 在多个数据集上,通过上下文学习和微调,将 NuNER 的性能与 GPT-3.5、GPT-4 和 UniversalNER 进行对比。
  • 系统性地消融数据集规模、实体类型多样性和文本多样性对模型性能的影响。
  • 使用两层前馈网络配合 Dropout 作为分类头,微调阶段训练 30 个周期。
Figure 1: NuNER creation procedure. RoBERTa is further pre-trained on a subset of C4 automatically annotated by GPT-3.5. The resulting model can be fine-tuned on various downstream NER problems.
Figure 1: NuNER creation procedure. RoBERTa is further pre-trained on a subset of C4 automatically annotated by GPT-3.5. The resulting model can be fine-tuned on various downstream NER problems.

实验结果

研究问题

  • RQ1LLM 标注的数据能否有效用于预训练紧凑的、任务特定的基础模型以实现 NER?
  • RQ2在 few-shot NER 设置下,NuNER 的性能与 GPT-3.5 和 GPT-4 等大型语言模型相比如何?
  • RQ3哪些因素——数据集规模、实体类型多样性或文本多样性——对任务特定基础模型的性能影响最大?
  • RQ4更小的、基于编码器的模型 NuNER 是否能与更大的生成式模型(如 UniversalNER)相媲美或超越其性能?
  • RQ5NuNER 的预训练过程是否增强了最终网络层中人类概念的可访问性,从而提升 few-shot 微调效率?

主要发现

  • 在 few-shot 设置下,NuNER 超过了其基础 RoBERTa 模型和参数量相近的 NER-BERT 预训练模型,证明了 LLM 标注数据的有效性。
  • 当微调时每个实体类型使用超过 8 个词时,NuNER 的性能优于 GPT-3.5,且可与 GPT-4 竞争,表明大型模型在上下文学习方面存在局限性。
  • 尽管参数量仅为 UniversalNER 的 1/56,NuNER 在 $k\sim2k$ few-shot 设置下于 $64\sim128$ 词的测试集上实现了与之相当的性能(F1 得分为 70.30±0.35)。
  • 实体类型多样性和数据集规模是影响 NuNER 性能的最关键因素,而文本多样性影响甚微。
  • 对比学习预训练过程增强了最终网络层中人类概念的涌现,可能提升了 few-shot 微调的效率。
  • NuNER 可作为 RoBERTa 在 NER 任务中的强大即插即用替代品,在计算成本极低的情况下提供了更优的 few-shot 泛化能力。
Figure 4: Frequency of each concept assigned by GPT-3.5, sorted from most to least common. We observe a heavy-tailed distribution.
Figure 4: Frequency of each concept assigned by GPT-3.5, sorted from most to least common. We observe a heavy-tailed distribution.

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。