Skip to main content
QUICK REVIEW

[论文解读] Evaluation of Greek Word Embeddings

Stamatis Outsios, Christos Karatsalos|arXiv (Cornell University)|Apr 8, 2019
Natural Language Processing Techniques参考文献 21被引用 5
一句话总结

本论文通过新创建的希腊语词汇类比测试集和希腊语版WordSim353,评估了希腊语词嵌入模型。模型在50GB希腊语网络语料上进行训练,结果表明词形复杂性和多义性显著影响性能表现,其中gr_def模型在词相似性任务中达到最高皮尔逊相关系数(0.6042),表现最佳的模型在使用3CosMul和top-1向量时,类比任务准确率达到68.97%。

ABSTRACT

Since word embeddings have been the most popular input for many NLP tasks, evaluating their quality is of critical importance. Most research efforts are focusing on English word embeddings. This paper addresses the problem of constructing and evaluating such models for the Greek language. We created a new word analogy corpus considering the original English Word2vec word analogy corpus and some specific linguistic aspects of the Greek language as well. Moreover, we created a Greek version of WordSim353 corpora for a basic evaluation of word similarities. We tested seven word vector models and our evaluation showed that we are able to create meaningful representations. Last, we discovered that the morphological complexity of the Greek language and polysemy can influence the quality of the resulting word embeddings.

研究动机与目标

  • 评估希腊语词嵌入质量,希腊语是一种词形丰富但资源较少的语言。
  • 开发并发布一个新的希腊语词汇类比测试集,以捕捉句法、词形句法和语义关系。
  • 创建希腊语版WordSim353,用于内在评估词相似性。
  • 比较在大规模希腊语网络语料上训练的多种预训练词嵌入模型。
  • 识别影响希腊语词嵌入质量的语言因素,如多义性和词形复杂性。

提出的方法

  • 在从2000万个URL中提取的50GB希腊语网络语料上,训练了七种词嵌入模型(CBOW、Skip-gram及其变体)。
  • 基于原始英文Word2vec类比基准,创建了一个针对希腊语语言特征进行调整的新希腊语词汇类比测试集。
  • 将WordSim353数据集翻译并适配为希腊语,用于评估词相似性。
  • 采用内在评估方法对模型进行评估:词汇类比(3CosAdd和3CosMul)和词相似性(皮尔逊相关系数)。
  • 在类比任务中应用top-1和top-5最近邻搜索,并报告在语义、句法及子类别中的性能表现。
  • 使用在线网页工具,支持对词向量和类比关系的交互式探索。

实验结果

研究问题

  • RQ1在使用内在基准评估时,最先进的词嵌入模型在希腊语上的表现如何?
  • RQ2希腊语中的词形复杂性和多义性在多大程度上影响词表示的学习质量?
  • RQ3词嵌入在不同类比子类别(如currency_country或反义词)中的表现有何差异?
  • RQ4哪种预训练模型在希腊语中与人工标注的词相似性评分具有最高的相关性?
  • RQ5不同的向量相似性方法(3CosAdd与3CosMul)在希腊语类比和相似性任务中的表现有何影响?

主要发现

  • gr_def模型在希腊语WordSim353相似性基准测试中与人工评分的相关系数最高,达到0.6042。
  • cc.el.300模型在使用3CosMul和top-1向量时,在词汇类比任务中达到最高准确率68.97%。
  • 与“opposite”类别相比,模型在“antonyms”类别中的表现显著更差,原因在于词汇复杂性更高。
  • 所有模型在“nationality_adjectives”类别中,对阳性形式的性能优于阴性形式,表明模型对词形变化具有敏感性。
  • OOV率较高的子类别(如adjectives_antonyms和performer_action)始终表现出较低的性能。
  • 3CosMul方法在大多数情况下优于3CosAdd,尤其在放大较小相似度值的差异方面表现更优。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。