Skip to main content
QUICK REVIEW

[论文解读] Beyond Bilingual: Multi-sense Word Embeddings using Multilingual Context

Shyam Upadhyay, Kai-Wei Chang|arXiv (Cornell University)|Jun 25, 2017
Topic Modeling参考文献 33被引用 11
一句话总结

本文提出了一种多视角贝叶斯非参数模型,利用多语言语料库学习多义词嵌入,实现对每个词的可变义项数量的数据驱动推断。通过以英语为桥梁,在多种语言间联合训练,该方法在多义消歧方面显著优于双语或单语方法,性能可与在五倍数据量上训练的最先进单语模型相媲美。

ABSTRACT

Word embeddings, which represent a word as a point in a vector space, have become ubiquitous to several NLP tasks. A recent line of work uses bilingual (two languages) corpora to learn a different vector for each sense of a word, by exploiting crosslingual signals to aid sense identification. We present a multi-view Bayesian non-parametric algorithm which improves multi-sense word embeddings by (a) using multilingual (i.e., more than two languages) corpora to significantly improve sense embeddings beyond what one achieves with bilingual information, and (b) uses a principled approach to learn a variable number of senses per word, in a data-driven manner. Ours is the first approach with the ability to leverage multilingual corpora efficiently for multi-sense representation learning. Experiments show that multilingual training significantly improves performance over monolingual and bilingual training, by allowing us to combine different parallel corpora to leverage multilingual context. Multilingual training yields comparable performance to a state of the art mono-lingual model trained on five times more training data.

研究动机与目标

  • 为解决双语跨语言方法在消歧方面存在的局限性,通过扩展至多语言语料库来改进。
  • 实现每个词的可变义项数量的数据驱动推断,避免固定义项假设导致的参数浪费。
  • 通过在多种语言间联合建模词嵌入,以英语作为共享参考点,提升多义表示学习效果。
  • 证明多语言训练可在显著更少的训练数据下,实现与大型单语模型相当的性能。

提出的方法

  • 该模型采用贝叶斯非参数框架,基于单语和多语言上下文中的证据,推断每个词的可变义项向量数量。
  • 通过在共享向量空间中对齐,联合学习多种语言的词嵌入,使用英语作为连接外语文本表示的桥梁。
  • 该方法采用跨语言上下文窗口,捕捉来自多种语言的分布信号,每种语言使用独立的窗口大小以优化信号质量。
  • 将多个平行语料库(例如,英法、英中)整合为单一多语言训练语料库,以提升覆盖范围和消歧能力。
  • 使用中英法平行语料库(MultiUN)评估语言家族影响,并优化跨语言窗口参数。
  • 通过狄利克雷过程先验进行义项推断,使模型在跨语言证据支持下可动态添加新的义项向量。

实验结果

研究问题

  • RQ1多语言分布信息是否能显著提升多义词嵌入质量,超越仅依赖双语信号所能达到的效果?
  • RQ2使用语系相距较远的语言(如汉藏语系)作为跨语言信号,是否比使用语系相近的语言(如印欧语系)提供更好的消歧信号?
  • RQ3跨语言窗口大小的选择如何影响不同语言对之间的义项聚类性能?
  • RQ4能否通过非参数模型实现每个词的可变义项数量推断,从而在数据效率和准确性上超越固定义项模型?
  • RQ5多语言训练在多大程度上可实现与大型单语模型相当的性能,且训练数据量显著更少?

主要发现

  • 多语言训练显著优于单语言和双语言训练,性能可与在五倍数据量上训练的最先进单语模型相媲美。
  • 使用非印欧语系语言(如中文)作为跨语言信号,其消歧性能略优于使用印欧语系语言,表明语言距离可增强信号多样性。
  • 增大跨语言窗口大小可提升部分语言对(如英中)的性能,但会损害其他语言对(如英法)的性能,表明需针对不同语言进行窗口参数的个性化调优。
  • 多语言模型在嵌入空间中实现了更优的义项向量聚类,如主成分分析(PCA)可视化所示,'bank'、'interest'和'apple'等词的义项分离更清晰。
  • 该模型以数据驱动方式成功推断每个词的可变义项数量,避免了过度参数化,提升了效率。
  • 该方法证明,结合多个平行语料库可有效利用多语言上下文,即使单个双语语料库规模较小也能实现良好效果。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。