[论文解读] Massive vs. Curated Word Embeddings for Low-Resourced Languages. The Case of Yorùbá and Twi
本文比较了大规模自动收集的词嵌入(如来自维基百科和Common Crawl)与为低资源非洲语言(约鲁巴语和丰蒂语)精心整理的高质量语料库。结果表明,数据质量远超数据量,词相似度相关性分别达到39%和44%(而大规模嵌入仅为14%),并显示语言特定的预处理和模型架构选择(如字符级模型)可进一步提升性能,特别是在使用单语约鲁巴语数据微调多语言BERT时表现更优。
The success of several architectures to learn semantic representations from unannotated text and the availability of these kind of texts in online multilingual resources such as Wikipedia has facilitated the massive and automatic creation of resources for multiple languages. The evaluation of such resources is usually done for the high-resourced languages, where one has a smorgasbord of tasks and test sets to evaluate on. For low-resourced languages, the evaluation is more difficult and normally ignored, with the hope that the impressive capability of deep learning architectures to learn (multilingual) representations in the high-resourced setting holds in the low-resourced setting too. In this paper we focus on two African languages, Yorùbá and Twi, and compare the word embeddings obtained in this way, with word embeddings obtained from curated corpora and a language-dependent processing. We analyse the noise in the publicly available corpora, collect high quality and noisy data for the two languages and quantify the improvements that depend not only on the amount of data but on the quality too. We also use different architectures that learn word representations both from surface forms and characters to further exploit all the available information which showed to be important for these languages. For the evaluation, we manually translate the wordsim-353 word pairs dataset from English into Yorùbá and Twi. As output of the work, we provide corpora, embeddings and the test suits for both languages.
研究动机与目标
- 评估大规模自动收集的词嵌入(如来自维基百科和Common Crawl)与为低资源非洲语言(如约鲁巴语和丰蒂语)精心整理的高质量语料库的性能。
- 研究数据质量、数量以及语言特定特征(如变音符号、拼写方式)如何影响低资源环境下的词嵌入质量。
- 开发并发布为约鲁巴语和丰蒂语精心整理的语料库、词嵌入以及评估基准(包括人工翻译的Wordsim-353和命名实体标注的Global Voices语料库)。
- 评估在单语约鲁巴语数据上微调的上下文嵌入(如多语言BERT)在低资源自然语言处理任务(如命名实体识别)中的有效性。
- 证明在低资源环境下,语言特定的数据整理与模型架构选择比单纯的数据量更为关键。
提出的方法
- 从维基百科、Common Crawl和JW300语料库等来源收集并整理了高质量、低噪声的约鲁巴语和丰蒂语语料库,并通过母语者验证。
- 使用fastText和字符级模型(CWE-LP)训练词嵌入,比较其在表面形式与字符级表示上的性能表现。
- 人工将Wordsim-353词相似度数据集翻译为约鲁巴语和丰蒂语,以建立金标准评估基准。
- 对Global Voices语料库中的约鲁巴语文本进行命名实体标注,以支持在序列标注任务中评估上下文嵌入。
- 使用多语言和仅约鲁巴语的词汇表,在单语约鲁巴语数据上对多语言BERT进行微调,为保持一致性忽略变音符号。
- 使用Wordsim-353数据集的皮尔逊相关系数和命名实体识别任务的F1分数评估嵌入性能,比较精心整理与大规模嵌入以及不同模型配置的差异。
实验结果
研究问题
- RQ1在大规模自动收集的语料库(如维基百科和Common Crawl)上训练的词嵌入,与在精心整理的高质量语料库上训练的词嵌入相比,对低资源语言(如约鲁巴语和丰蒂语)的性能如何?
- RQ2在低资源环境下,数据质量(而非单纯的数据量)在多大程度上影响词嵌入的性能?
- RQ3语言特定特征(如变音符号、拼写变体)在多大程度上影响模型架构选择与预处理策略?
- RQ4在单语、精心整理的数据上微调多语言BERT,是否能显著提升低资源语言在命名实体识别等下游NLP任务中的性能?
- RQ5与通用预训练嵌入相比,精心整理的语料库和语言特定建模在多大程度上提升了词相似度相关性和命名实体识别性能?
主要发现
- 在大规模维基百科和Common Crawl数据上训练的fastText嵌入在约鲁巴语和丰蒂语上的词相似度相关性仅为0.14,表明语义质量较差。
- 经过数据整理后,词嵌入在Wordsim-353测试集上的相关性分别达到约鲁巴语39%和丰蒂语44%,相比大规模嵌入提升了170%。
- 在丰蒂语中,使用74.2万条精心整理的词元训练的模型优于使用1600万条噪声数据的模型,凸显了数据质量的关键作用。
- 与n-gram模型(fastText)相比,使用字符级模型(CWE-LP)可提升丰蒂语嵌入质量,尤其在结合高质量数据时效果更显著。
- 在单语约鲁巴语数据上微调多语言BERT后,F1分数从基础模型的27%提升至56%以上,若使用仅约鲁巴语的词汇表,性能再提升4%。
- 尽管维基百科被视为高质量语料库,但其仍包含大量噪声(如非母语文本、代码混用、缺失变音符号),在未经整理的情况下对低资源语言并不适用。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。