[论文解读] Evaluation of Croatian Word Embeddings
本文使用新创建的数据集——克罗地亚WordSim353、RG65以及一个包含115,085个词对的稳健词类比语料库——评估克罗地亚词嵌入,对比在13.7亿词符的语料上训练的Word2Vec与fastText模型。结果表明,尽管模型生成了有意义的表示,但其性能仍落后于英语,原因在于克罗地亚语的高度屈折复杂性和自由词序,凸显了在斯拉夫语言中进行语言特定模型改进的必要性。
Croatian is poorly resourced and highly inflected language from Slavic language family. Nowadays, research is focusing mostly on English. We created a new word analogy corpus based on the original English Word2vec word analogy corpus and added some of the specific linguistic aspects from Croatian language. Next, we created Croatian WordSim353 and RG65 corpora for a basic evaluation of word similarities. We compared created corpora on two popular word representation models, based on Word2Vec tool and fastText tool. Models has been trained on 1.37B tokens training data corpus and tested on a new robust Croatian word analogy corpus. Results show that models are able to create meaningful word representation. This research has shown that free word order and the higher morphological complexity of Croatian language influences the quality of resulting word embeddings.
研究动机与目标
- 为解决自然语言处理中克罗地亚词嵌入缺乏评估资源的问题。
- 创建新的语言特定数据集——克罗地亚WordSim353、RG65以及大规模词类比语料库——用于语义与句法评估。
- 对比Word2Vec与fastText在克罗地亚语上的表现,克罗地亚语是一种高度屈折的斯拉夫语言,具有自由词序。
- 研究屈折复杂性与句法灵活性如何影响克罗地亚语中词嵌入的质量。
- 为未来研究提供公开可用的、英克罗地亚语并行词嵌入数据集。
提出的方法
- 构建了一个包含115,085个问题的新型克罗地亚词类比语料库,分为语义与句法类型,包括语言特定类别如动词-过去式-阳性/阴性与国籍-男性/女性。
- 将现有的英文词相似度数据集(WordSim353与RG65)翻译为克罗地亚语,用于基本语义评估。
- 在来自克罗地亚维基百科的13.7亿词符的克罗地亚单语语料库上训练Word2Vec与fastText模型。
- 使用新类比语料库与翻译后的相似度数据集评估模型,通过与人工标注判断的相关性来衡量性能。
- 分析模型在城市-国家、国家-世界与货币等类别中的表现,以评估知识保留能力与屈折敏感性。
- 与英语基准进行对比,突出由于屈折与句法差异导致的性能差距。
实验结果
研究问题
- RQ1当在新创建的综合性类比语料库上评估时,Word2Vec与fastText在克罗地亚词嵌入上的表现如何?
- RQ2克罗地亚语的屈折复杂性与自由词序在多大程度上影响了所学词表示的质量?
- RQ3克罗地亚语中语义与句法类比任务的表现与英语相比如何,特别是在过去时动词对与性别相关词对等类别中?
- RQ4模型能否有效捕捉克罗地亚语中的国家-城市与州-首府关系?训练数据的覆盖范围在多大程度上影响这一能力?
- RQ5词形频率(如阳性与阴性形式)在性别与屈折类比任务中的模型表现中扮演何种角色?
主要发现
- 克罗地亚词类比语料库包含115,085个问题,涵盖12个类别,其中语义类有36,880个,句法类有78,205个,可实现对句法与语义关系的稳健评估。
- 句法类比,尤其是过去时动词对,表现相对较高——表明斯拉夫语言的屈折模式可能比英语更具规律性。
- 在训练数据覆盖相关实体(如克罗地亚城市)时,城市-国家等语义类别表现良好,但对代表性不足的主题(如美国州)表现显著下降。
- 货币类别在所有模型中均表现持续不佳,表明在建模抽象或罕见语义关系方面存在普遍弱点。
- 在相似度任务(WordSim353与RG65)中,克罗地亚语训练模型的相关性得分低于相应英语模型,表明性能差距与屈折复杂性相关。
- 阳性词形的表现优于阴性词形,反映出训练数据中阳性形式频率更高,从而影响了性别类比的准确性。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。