Skip to main content
QUICK REVIEW

[论文解读] Learning Contextualised Cross-lingual Word Embeddings for Extremely Low-Resource Languages Using Parallel Corpora.

Takashi Wada, Tomoharu Iwata|arXiv (Cornell University)|Oct 27, 2020
Topic Modeling参考文献 55被引用 4
一句话总结

本文提出了一种在极低资源条件下进行跨语言词嵌入的方法,采用共享的LSTM编码器-解码器模型,在少量平行语料(例如几百对句子)上进行训练。通过双向翻译和重建任务联合学习跨语言的上下文嵌入,并结合词级与子词级表示,该模型在濒危语言(如永宁白、希皮博-科尼博和格里科语)的双语词典归纳与词对齐任务中取得了当前最优的性能表现。

ABSTRACT

We propose a new approach for learning contextualised cross-lingual word embeddings based only on a small parallel corpus (e.g. a few hundred sentence pairs). Our method obtains word embeddings via an LSTM-based encoder-decoder model that performs bidirectional translation and reconstruction of the input sentence. Through sharing model parameters among different languages, our model jointly trains the word embeddings in a common multilingual space. We also propose a simple method to combine word and subword embeddings to make use of orthographic similarities across different languages. We base our experiments on real-world data from endangered languages, namely Yongning Na, Shipibo-Konibo and Griko. Our experiments on bilingual lexicon induction and word alignment tasks show that our model outperforms existing methods by a large margin for most language pairs. These results demonstrate that, contrary to common belief, an encoder-decoder translation model is beneficial for learning cross-lingual representations, even in extremely low-resource scenarios.

研究动机与目标

  • 解决在极低资源和濒危语言中,仅使用极少平行数据时学习有效跨语言表示的挑战。
  • 通过采用共享多语言架构,克服现有方法在数据稀缺情况下的局限性。
  • 通过跨语言联合训练词嵌入,提升极低资源设置下的跨语言迁移性能。
  • 通过结合词级与子词级嵌入,利用语言间的拼写相似性,提升表示质量。

提出的方法

  • 在少量平行语料上训练基于LSTM的编码器-解码器模型,以执行双向翻译和句子重建。
  • 在不同语言之间共享模型参数,以在共享的多语言嵌入空间中联合学习词嵌入。
  • 使用重建损失以在翻译过程中保留语义和句法结构,从而提升嵌入质量。
  • 通过可学习机制结合词级与子词级嵌入,以利用跨语言间的拼写相似性。
  • 仅使用平行句子对端到端训练模型,无需单语数据或外部资源。
  • 将学习到的嵌入应用于下游任务,如双语词典归纳与词对齐。

实验结果

研究问题

  • RQ1在仅几百对平行句子对上训练的编码器-解码器模型,是否能在极低资源设置下有效学习上下文化的跨语言词嵌入?
  • RQ2与单语或独立训练相比,跨语言参数共享是否能提升跨语言表示的质量?
  • RQ3在形态多样的或低资源语言中,词与子词嵌入的结合在多大程度上能提升跨语言任务的性能?
  • RQ4与现有最先进方法相比,该方法在濒危语言的双语词典归纳与词对齐任务中的表现如何?

主要发现

  • 所提出的模型在多个语言对的双语词典归纳与词对齐任务中,显著优于现有方法。
  • 即使仅使用几百对平行句子对,模型仍表现出色,证明了其在极低资源场景下的有效性。
  • 通过双向翻译与重建进行的联合训练,显著提升了跨语言词嵌入的质量。
  • 词与子词嵌入的结合能更好地捕捉跨语言相似性,尤其在具有共同拼写特征的语言中表现更优。
  • 该方法在真实濒危语言数据(包括永宁白、希皮博-科尼博和格里科语)上取得了当前最优结果。
  • 结果挑战了序列到序列模型在极低资源设置下不适合用于跨语言表示学习的普遍看法。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。