Skip to main content
QUICK REVIEW

[论文解读] Using Similarity Measures to Select Pretraining Data for NER

Xiang Dai, Sarvnaz Karimi|arXiv (Cornell University)|Apr 1, 2019
Topic Modeling参考文献 50被引用 18
一句话总结

本文提出了三种成本效益高的相似性度量方法——目标词汇覆盖率、语言模型困惑度和词向量方差——以预测命名实体识别(NER)预训练数据的有效性。实验证明,这些度量方法能可靠地预测性能表现,表明在使用预训练语言模型而非词向量时,小型且相似的数据集相较于大型通用数据集表现更优。

ABSTRACT

Word vectors and Language Models (LMs) pretrained on a large amount of unlabelled data can dramatically improve various Natural Language Processing (NLP) tasks. However, the measure and impact of similarity between pretraining data and target task data are left to intuition. We propose three cost-effective measures to quantify different aspects of similarity between source pretraining and target task data. We demonstrate that these measures are good predictors of the usefulness of pretrained models for Named Entity Recognition (NER) over 30 data pairs. Results also suggest that pretrained LMs are more effective and more predictable than pretrained word vectors, but pretrained word vectors are better when pretraining data is dissimilar.

研究动机与目标

  • 为解决当前NER任务预训练数据选择缺乏系统性方法、主要依赖启发式直觉的问题。
  • 开发成本低廉、可量化的度量方法,以预测预训练词向量或语言模型在目标NER数据集上的表现。
  • 探究领域(主题内容)和语域(语篇语境)的相似性是否对有效预训练至关重要。
  • 评估在性能和计算成本方面,是否适度且相似的预训练数据可优于大规模通用语料库。
  • 为研究人员提供一种实用、基于数据的框架,以选择最优预训练数据,而无需进行大量试错。

提出的方法

  • 提出三种相似性度量方法:(1) 目标词汇覆盖率(VCcR),衡量源语料与目标语料词汇之间的重叠程度;(2) 语言模型困惑度,评估语言模型对目标数据的拟合程度;(3) 词向量方差,衡量在目标数据上微调后词向量的变化程度。
  • 使用跳字模型与负采样(word2vec)训练词向量,使用标准Transformer架构训练语言模型,数据来源为多种源语料库。
  • 在30对数据对上评估预训练模型,涵盖五个源语料库和六个目标NER数据集,覆盖多样化的领域(如生物学、本地商业)和语域(如维基百科、评论、医疗指南)。
  • 通过统计相关性分析,评估每种度量方法预测下游NER F1分数提升的能力。
  • 开展消融研究,以分离源数据规模、相似性以及超参数设置对模型性能的影响。
  • 与在更大规模语料库上预训练的公开可用模型进行对比,以验证其成本效益。

实验结果

研究问题

  • RQ1目标词汇覆盖率、语言模型困惑度和词向量方差能否作为NER预训练数据有效性的可靠预测指标?
  • RQ2领域和语域的相似性是否显著影响预训练模型的性能,还是仅领域相似性已足够?
  • RQ3在NER性能和计算成本方面,小型、领域特定的预训练语料库是否能优于大规模通用语料库?
  • RQ4在源数据与目标数据相似性不同的情况下,选择预训练词向量还是预训练语言模型如何影响性能?
  • RQ5源数据规模在多大程度上调节了相似性对模型性能的影响?

主要发现

  • 目标词汇覆盖率(VCcR)是预测预训练词向量有效性的最强指标,词汇重叠度越高,NER性能越好。
  • 当源数据与目标数据相似时,预训练语言模型优于词向量,在WetLab上达到最高79.62的F1分数,在ScienceIE上达到42.07的F1分数(经优化设置)。
  • 在500 MB的PubMed数据上预训练的模型,其性能优于在10亿词的通用数据上训练的模型,且训练时间从数周缩短至数小时。
  • 对于不相似的数据对(如PubMed到CoNLL2003),无论源数据规模如何,预训练词向量始终优于语言模型。
  • Chiu et al. (2016) 提出的超参数设置在大多数数据对上均提升了词向量性能,但相似性的影响仍占主导地位。
  • 当源数据规模超过500 MB后,收益递减,表明相似性比规模对有效预训练更为关键。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。