Skip to main content
QUICK REVIEW

[论文解读] Prompt-based Text Entailment for Low-Resource Named Entity Recognition

Dongfang Li, Baotian Hu|arXiv (Cornell University)|Nov 6, 2022
Topic Modeling被引用 6
一句话总结

本文提出了一种基于提示的文本蕴含(PTE)方法,这是一种新颖的方法,通过使用预训练语言模型(PLMs)将低资源命名实体识别(NER)重新表述为文本蕴含任务。通过将特定于实体类型的提示视为假设,输入句子作为前提,PTE在无需微调的情况下利用PLM的知识,在每个实体类型少于50个标注样本的MIT Movie和Few-NERD数据集上实现了最先进性能。

ABSTRACT

Pre-trained Language Models (PLMs) have been applied in NLP tasks and achieve promising results. Nevertheless, the fine-tuning procedure needs labeled data of the target domain, making it difficult to learn in low-resource and non-trivial labeled scenarios. To address these challenges, we propose Prompt-based Text Entailment (PTE) for low-resource named entity recognition, which better leverages knowledge in the PLMs. We first reformulate named entity recognition as the text entailment task. The original sentence with entity type-specific prompts is fed into PLMs to get entailment scores for each candidate. The entity type with the top score is then selected as final label. Then, we inject tagging labels into prompts and treat words as basic units instead of n-gram spans to reduce time complexity in generating candidates by n-grams enumeration. Experimental results demonstrate that the proposed method PTE achieves competitive performance on the CoNLL03 dataset, and better than fine-tuned counterparts on the MIT Movie and Few-NERD dataset in low-resource settings.

研究动机与目标

  • 解决在标注数据稀缺的低资源环境下训练准确NER模型的挑战。
  • 克服微调方法的局限性,后者需要大量标注数据,并且在低资源场景下存在高方差问题。
  • 通过将NER重新表述为文本蕴含任务,更有效地利用预训练语言模型,实现在不同领域之间的知识迁移。
  • 开发一种统一的推理框架,适用于不同领域,且无需完整的序列标注。
  • 通过使用提示学习实现有效的少样本和零样本NER,仅需极少监督。

提出的方法

  • 将NER重新表述为文本蕴含任务:输入句子作为前提,特定于实体类型的提示作为假设。
  • 使用PLM为每个标记位置的每个候选实体类型计算蕴含分数,并选择得分最高的类型作为最终标签。
  • 将标注标签注入提示中,并将单个词作为基本单位而非n-gram片段,以降低计算复杂度。
  • 采用离散和软提示调优策略以提升性能,尤其是在低资源场景下。
  • 利用通用文本蕴含数据集(如SNLI、MNLI)进行预训练,以增强在低资源领域中的泛化能力。
  • 采用基于提示的学习方法,不引入额外分类层,从而避免在下游NER任务上进行微调的需要。

实验结果

研究问题

  • RQ1将NER重新表述为文本蕴含任务是否能在低资源设置下提升性能?
  • RQ2当仅有少量标注样本时,基于提示的文本蕴含与标准微调相比表现如何?
  • RQ3提示设计(包括标签条件化和软提示 vs. 离散提示)对低资源NER性能有何影响?
  • RQ4来自通用文本蕴含数据集的知识是否能在无需领域特定微调的情况下提升少样本NER性能?
  • RQ5与标准的逐标记预测相比,基于蕴含的方法是否能更好地保持词汇和语义连贯性?

主要发现

  • PTE在CoNLL03数据集上取得了具有竞争力的F1分数,该数据集作为丰富的资源基准。
  • 在MIT Movie数据集上,PTE显著优于微调后的BERT模型,尤其是在每个实体类型少于50个标注样本时。
  • 在Few-NERD数据集上,采用软提示的PTE在500-shot设置下达到了67.4的F1分数,显著优于次佳方法(66.8),并且在低样本设置下表现出一致的性能提升。
  • 软提示变体始终优于离散变体,尤其是在低资源场景下,表明连续提示优化具有优势。
  • 消融实验表明,负样本(尤其是空标签)对性能至关重要,其影响在低资源场景下更为显著。
  • 标签条件化和软提示始终能提升模型性能,凸显其在有效基于提示的知识迁移用于NER中的重要性。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。