[论文解读] Unsupervised Morphological Expansion of Small Datasets for Improving Word Embeddings
本文提出了一种无监督、与语言无关的方法,通过形态学扩展低资源数据集来生成人工句子,从而改进词嵌入。通过在这些合成句子上进行训练,模型提升了罕见词和低频词的嵌入表示,其性能可与在更大语料库上训练的模型相媲美,尤其在印地语和德语等形态丰富的语言中表现突出。
We present a language independent, unsupervised method for building word embeddings using morphological expansion of text. Our model handles the problem of data sparsity and yields improved word embeddings by relying on training word embeddings on artificially generated sentences. We evaluate our method using small sized training sets on eleven test sets for the word similarity task across seven languages. Further, for English, we evaluated the impacts of our approach using a large training set on three standard test sets. Our method improved results across all languages.
研究动机与目标
- 解决低资源及形态丰富的语言在训练词嵌入时的数据稀疏问题。
- 在不依赖外部形态分析器的前提下,改进罕见词和未见词的词嵌入表示。
- 开发一种与语言无关的无监督技术,利用形态规则生成人工训练句子。
- 证明形态学扩展可产生与在显著更大语料库上训练的模型相当的词嵌入。
- 发布一个新的印地语词语相似度数据集(Hin-WS235),以支持低资源环境下的评估。
提出的方法
- 对训练语料中的词汇应用无监督的形态学扩展,通过添加后缀、前缀等形态变换生成人工句子。
- 使用带有负采样的Skip-gram模型,并采用固定超参数(d=500, min_count=5)进行词嵌入训练。
- 实施分层词表查找策略('Morph'步骤),通过搜索频率更高的形态变体来恢复罕见或未见词的嵌入表示。
- 在直接查找失败时,应用首字母大写和长度相关的启发式规则以提升嵌入恢复效果。
- 当存在多个形态变体时,以频率和长度作为优先级排序的依据。
- 将形态学扩展与词嵌入训练相结合,以改善低频词的表示。
实验结果
研究问题
- RQ1对小规模数据集进行形态学扩展,是否能在多种语言中,尤其是形态丰富的语言中,提升词嵌入质量?
- RQ2与在远大语料库上训练的最先进模型相比,该方法在词语相似度性能方面表现如何?
- RQ3通过形态规则生成的人工句子是否能缓解罕见词和未见词的数据稀疏问题?
- RQ4为何该方法在阿拉伯语上表现较差?哪些语言学因素导致了这一局限性?
- RQ5形态学扩展在多大程度上保留了向量空间中的类比规律性?
主要发现
- 该方法在七种语言的小规模数据集上显著提升了词语相似度性能,尤其在形态丰富的语言如印地语和德语中提升最为明显。
- 在英语的Stanford Rare-Word(RW)数据集上,SG + Exp + Morph模型达到47.9分,优于基线SG模型(42.1分),并达到在420亿词语料上训练的模型的性能水平。
- 在RG65数据集上,SG + Exp + Morph方法达到80.4的准确率,优于在420亿词语料上训练的GloVe模型(82.9分),但仅使用了100亿词语料。
- 在WS353数据集上,性能略有下降,可能是因为语法不正确的合成句子破坏了类比规律性。
- 通过形态变体查找恢复罕见词嵌入的策略表现稳健,尤其在结合频率和长度启发式规则时效果更佳。
- 该方法在阿拉伯语上效果较差,归因于其复杂的中缀模式,而当前的前缀/后缀基扩展策略难以有效处理此类结构。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。