Skip to main content
QUICK REVIEW

[论文解读] Cross-Lingual Syntactic Transfer through Unsupervised Adaptation of Invertible Projections

Junxian He, Zhisong Zhang|arXiv (Cornell University)|Jun 6, 2019
Natural Language Processing Techniques参考文献 36被引用 4
一句话总结

本文提出一种基于可逆投影的生成式跨语言迁移方法,通过在源语言和目标语言之间实现软参数共享,对齐远距离语言表征并适配句法模型。通过在共享的跨语言潜在空间中联合训练带标签的源语言数据和无标签的目标语言数据,该方法在仅以英语为源语言的10种类型学上差异较大的语言上,相较于直接迁移基线方法,实现了POS标注5.2%的绝对提升和依存句法分析8.3%的绝对提升。

ABSTRACT

Cross-lingual transfer is an effective way to build syntactic analysis tools in low-resource languages. However, transfer is difficult when transferring to typologically distant languages, especially when neither annotated target data nor parallel corpora are available. In this paper, we focus on methods for cross-lingual transfer to distant languages and propose to learn a generative model with a structured prior that utilizes labeled source data and unlabeled target data jointly. The parameters of source model and target model are softly shared through a regularized log likelihood objective. An invertible projection is employed to learn a new interlingual latent embedding space that compensates for imperfect cross-lingual word embedding input. We evaluate our method on two syntactic tasks: part-of-speech (POS) tagging and dependency parsing. On the Universal Dependency Treebanks, we use English as the only source corpus and transfer to a wide range of target languages. On the 10 languages in this dataset that are distant from English, our method yields an average of 5.2% absolute improvement on POS tagging and 8.3% absolute improvement on dependency parsing over a direct transfer method using state-of-the-art discriminative models.

研究动机与目标

  • 解决在无标注目标语言数据或平行语料的情况下,跨语言句法迁移在类型学上差异较大的语言上性能较低的挑战。
  • 通过在结构化生成模型中引入软参数共享,联合建模带标签的源语言数据和无标签的目标语言数据,以提升迁移性能。
  • 学习一种更具表现力的、可逆的跨语言词嵌入转换,以弥补远距离语言对之间对齐不佳的问题。
  • 证明基于流的生成模型在无监督适应方面在POS标注和依存句法分析中的有效性。
  • 提供实证证据表明,具有可逆投影的生成模型在零样本迁移至远距离语言时,优于判别式基线方法。

提出的方法

  • 该方法采用可逆投影(归一化流)学习一个共享的跨语言潜在空间,以对齐源语言和目标语言的表征。
  • 在联合似然目标中引入结构化先验——POS标注使用HMM,依存句法分析使用DMV,结合带标签的源语言数据和无标签的目标语言数据。
  • 通过正则化的对数似然目标强制实施软参数共享,使模型能够同时适应目标语言的句法结构和词嵌入。
  • 模型通过端到端方式使用带标签的源语言数据和无标签的目标语言数据进行训练,实现对目标语言特征的无监督适应。
  • 该方法在Universal Dependencies Treebanks v2.2上进行评估,仅以英语作为源语言,目标语言为10种远距离语言。
  • 该方法使用fastText和mBERT词嵌入实现,以评估上下文表示的影响。

实验结果

研究问题

  • RQ1当无标注目标语言数据可用时,具有可逆投影的生成模型是否能提升远距离语言的跨语言句法迁移性能?
  • RQ2与线性投影相比,使用可逆投影在建模跨语言句法迁移方面有何差异?
  • RQ3在无标签目标语言数据上进行无监督适应,对POS标注和依存句法分析性能的提升程度如何?
  • RQ4所提方法的性能增益是否随语言距离变化而变化?如果是,其变化规律是什么?
  • RQ5上下文嵌入(如mBERT)是否能进一步提升基于流的生成模型在跨语言迁移中的性能?

主要发现

  • 所提方法在10种远距离语言上,相较于强大的判别式基线,平均实现了POS标注5.2%的绝对提升和依存句法分析8.3%的绝对提升。
  • 在远距离语言上,使用mBERT嵌入时,该方法在POS标注上平均比判别式基线高出6%,而使用fastText时高出3%。
  • 使用mBERT嵌入时,该方法在10种近邻语言中的7种上超越了判别式基线,平均提升3%。
  • 使用mBERT嵌入时,基于流的模型性能与使用fastText时相近,表明当前生成模型可能尚未完全利用上下文嵌入在依存句法分析中的优势。
  • 该方法在远距离语言上表现显著提升,但在使用mBERT时,部分近邻语言上被判别式基线超越,表明模型选择需根据语言接近程度进行权衡。
  • 结果表明,上下文嵌入有助于缓解生成模型中的独立性假设,从而在不同语言距离上实现更优性能。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。