Skip to main content
QUICK REVIEW

[论文解读] Learning Numeral Embeddings

Chengyue Jiang, Zhonglin Nian|arXiv (Cornell University)|Dec 28, 2019
Mathematics Education and Teaching Techniques参考文献 30被引用 4
一句话总结

本文提出了两种新颖的数字嵌入方法,将任意数字表示为学习得到的原型数字嵌入的加权平均,利用自组织映射(SOM)或高斯混合模型(GMM)来生成原型。该方法能有效处理未登录词(OOV)数字,在数字相关自然语言处理任务中表现优于基线模型,尤其在低资源设置下,在词相似度、数值理解能力、预测和序列标注任务中均取得更优性能。

ABSTRACT

Word embedding is an essential building block for deep learning methods for natural language processing. Although word embedding has been extensively studied over the years, the problem of how to effectively embed numerals, a special subset of words, is still underexplored. Existing word embedding methods do not learn numeral embeddings well because there are an infinite number of numerals and their individual appearances in training corpora are highly scarce. In this paper, we propose two novel numeral embedding methods that can handle the out-of-vocabulary (OOV) problem for numerals. We first induce a finite set of prototype numerals using either a self-organizing map or a Gaussian mixture model. We then represent the embedding of a numeral as a weighted average of the prototype number embeddings. Numeral embeddings represented in this manner can be plugged into existing word embedding learning approaches such as skip-gram for training. We evaluated our methods and showed its effectiveness on four intrinsic and extrinsic tasks: word similarity, embedding numeracy, numeral prediction, and sequence labeling.

研究动机与目标

  • 为解决现有词嵌入方法在处理数字时表现不佳的问题,原因在于数字种类无限且在训练数据中频率较低。
  • 开发一种方法,能够为未登录词(OOV)数字(包括罕见或未见数字)生成有意义的嵌入表示。
  • 将数字嵌入集成到标准词嵌入框架(如skip-gram)中,无需从头开始重新训练模型。
  • 在涉及数字的内在和外在任务上评估所提方法的有效性。
  • 在数字意义和数值大小至关重要的下游NLP任务中提升性能,例如客户服务或临床文本处理。

提出的方法

  • 使用自组织映射(SOM)或高斯混合模型(GMM)从训练数据中诱导出有限数量的原型数字。
  • 将任意目标数字的嵌入表示为原型嵌入的加权平均,其中权重基于目标数字与每个原型之间的数值距离。
  • 将基于原型的数字嵌入作为输入,输入到标准词嵌入模型(如skip-gram)中,与非数字词联合训练。
  • 使用标准目标函数进行端到端训练,使系统能够同时学习词嵌入和数字嵌入表示。
  • 将学习到的嵌入应用于下游任务,如序列标注、词相似度和数字预测。
  • 使用验证集进行模型选择,评估时不进行微调,也不引入词性标注或字符级嵌入等额外特征。

实验结果

研究问题

  • RQ1基于原型的数字嵌入能否有效表示在训练数据中罕见或未见的未登录词数字?
  • RQ2与基线方法相比,所提出的数字嵌入在词相似度和嵌入数值理解等内在任务上的表现如何?
  • RQ3所提出的嵌入在数字预测和序列标注等外在任务上的性能提升程度如何?
  • RQ4在仅使用10%或30%训练数据的低资源条件下,该方法的泛化能力如何?
  • RQ5该方法能否区分数字的不同语义含义,例如表示年份的数字与表示数量的数字?

主要发现

  • 所提方法在序列标注任务中始终优于所有基线模型,在原始数据集、增强数据集和困难测试集上均取得了最高的F1分数。
  • 在客户服务数据集上,当使用100%的训练数据时,该方法在原始测试集上达到93.24的F1分数,在困难测试集上达到92.10,显著优于NumAsTok。
  • 在仅使用10%训练数据的低资源设置下,该方法相对于基线模型展现出更大的性能优势,表明其具有更好的泛化能力且对数据依赖性更低。
  • 该方法对数字扰动表现出强鲁棒性,在增强测试集上性能下降极小,而NumAsTok因OOV问题导致性能显著下降。
  • 基于原型的方法在数值理解能力方面表现出高精度,表明该方法成功编码了数值大小和数字间关系。
  • 结果表明,该方法能够有效建模数字的语义和数量双重特性,从而提升NLP系统中的推理能力。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。