Skip to main content
QUICK REVIEW

[论文解读] Unsupervised Cross-lingual Word Embedding by Multilingual Neural Language Models

Takashi Wada, Tomoharu Iwata|arXiv (Cornell University)|Sep 7, 2018
Topic Modeling参考文献 21被引用 19
一句话总结

本文提出一种多语言神经语言模型,通过在多种语言间共享双向LSTM,实现无平行数据下的无监督跨语言词嵌入学习,从而在不依赖平行语料的情况下联合学习句子级结构。该方法在低资源设置下表现达到最先进水平,并成功将四种语言映射到共享语义空间,在德语-英语对齐任务上甚至优于有监督基线模型。

ABSTRACT

We propose an unsupervised method to obtain cross-lingual embeddings without any parallel data or pre-trained word embeddings. The proposed model, which we call multilingual neural language models, takes sentences of multiple languages as an input. The proposed model contains bidirectional LSTMs that perform as forward and backward language models, and these networks are shared among all the languages. The other parameters, i.e. word embeddings and linear transformation between hidden states and outputs, are specific to each language. The shared LSTMs can capture the common sentence structure among all languages. Accordingly, word embeddings of each language are mapped into a common latent space, making it possible to measure the similarity of words across multiple languages. We evaluate the quality of the cross-lingual word embeddings on a word alignment task. Our experiments demonstrate that our model can obtain cross-lingual embeddings of much higher quality than existing unsupervised models when only a small amount of monolingual data (i.e. 50k sentences) are available, or the domains of monolingual data are different across languages.

研究动机与目标

  • 开发一种无需平行数据或预训练词嵌入的无监督方法,用于学习跨语言词嵌入。
  • 提升在单语数据有限或语言间领域不匹配的低资源设置下的鲁棒性。
  • 通过捕捉共享句法与语义结构,实现在多种语言间联合学习词嵌入。
  • 评估模型在远距离语言对(如芬兰语与英语)上对齐词的能力,此前方法在这些对上表现失败。
  • 通过在英语、法语、德语和西班牙语上联合训练,证明四语言词嵌入的可行性。

提出的方法

  • 模型在所有语言间共享双向LSTM(前向与后向),以编码句子级结构,实现跨语言对齐。
  • 词嵌入与输出投影层为语言特定,而LSTM参数共享,以强制结构共性。
  • 模型通过多语言单语句子的语言建模目标进行端到端训练。
  • 共享的LSTM将不同语言的词映射到同一潜在空间,从而实现跨语言语义相似性度量。
  • 模型利用<BOS>和<EOS>标记,并共享嵌入与线性投影,以一致地建模句子边界。
  • 该方法无需预训练或平行数据,完全依赖单语句子级监督。

实验结果

研究问题

  • RQ1多语言神经语言模型是否能在无任何平行数据或预训练词嵌入的情况下学习跨语言词嵌入?
  • RQ2当单语数据有限(如仅5万句)时,模型在低资源设置下的表现如何?
  • RQ3模型能否在语言差异大、领域不匹配严重的远距离语言对(如芬兰语与英语)上泛化?
  • RQ4是否可能通过单一无监督模型联合将两种以上语言嵌入到共享语义空间?
  • RQ5当仅提供少量双语词典时,模型性能与有监督基线相比如何?

主要发现

  • 当仅使用5万句单语句子时,所提模型在词对齐任务上优于所有现有无监督方法,尤其在低资源设置下表现突出。
  • 当仅使用350对双语词典进行训练时,模型在德语-英语词对齐任务上的表现优于有监督基线。
  • 在跨语言对齐任务中,当使用领域不匹配的数据时,模型在远距离语言对(如芬兰语-英语和捷克语-英语)上显著优于先前的无监督模型。
  • 在英语、法语、德语和西班牙语上联合训练的四语言词嵌入,成功将对应词汇映射到共享语义空间,t-SNE可视化与词对齐结果均验证了这一点。
  • 四语言词嵌入的t-SNE可视化显示,聚类按语义而非语言划分,介词、限定词和句首词在不同语言间形成清晰的语义簇。
  • 在领域分布发生变化时(即不同语言的单语数据来源或主题不同),模型表现出更优的稳定性和性能。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。