Skip to main content
QUICK REVIEW

[论文解读] Cross-Lingual BERT Transformation for Zero-Shot Dependency Parsing

Yuxuan Wang, Wanxiang Che|arXiv (Cornell University)|Sep 15, 2019
Topic Modeling参考文献 31被引用 12
一句话总结

本文提出跨语言 BERT 转换(CLBT),一种数据高效的模型,通过从上下文词对齐学习线性变换,将单语 BERT 嵌入映射到共享语义空间,实现零样本跨语言依存句法分析。CLBT 在先前静态嵌入方法的基础上,平均 LAS 提升了 2.91%,且在仅使用每种语言 10,000 组平行句、训练时间显著更短的情况下,性能与 XLM 相当或更优。

ABSTRACT

This paper investigates the problem of learning cross-lingual representations in a contextual space. We propose Cross-Lingual BERT Transformation (CLBT), a simple and efficient approach to generate cross-lingual contextualized word embeddings based on publicly available pre-trained BERT models (Devlin et al., 2018). In this approach, a linear transformation is learned from contextual word alignments to align the contextualized embeddings independently trained in different languages. We demonstrate the effectiveness of this approach on zero-shot cross-lingual transfer parsing. Experiments show that our embeddings substantially outperform the previous state-of-the-art that uses static embeddings. We further compare our approach with XLM (Lample and Conneau, 2019), a recently proposed cross-lingual language model trained with massive parallel data, and achieve highly competitive results.

研究动机与目标

  • 解决在低资源环境下跨语言迁移上下文表示的挑战。
  • 通过为多语言 BERT 嵌入学习共享语义空间,改进零样本跨语言依存句法分析。
  • 开发一种在数据效率和计算轻量化方面优于端到端跨语言预训练的方法。
  • 通过上下文感知变换,在跨语言对齐过程中保留词义区分。
  • 为 XLM 等大规模跨语言预训练模型提供一种快速、离线的替代方案。

提出的方法

  • CLBT 使用平行语料中的上下文词对齐,学习一个线性变换矩阵,将单语 BERT 嵌入映射到共享语义空间。
  • 该变换通过梯度下降(GD)或奇异值分解(SVD)在跨语言的对齐词标记上进行训练。
  • 使用学习到的变换将不同语言的预训练 BERT 模型的上下文嵌入投影到共享空间。
  • 该方法明确设计为保留词义,通过在词元级别而非词类级别对齐嵌入实现。
  • 该方法为离线操作,无需微调 BERT 模型,可应用于任意具有平行对齐的语种对。
  • 在推理时应用该变换,对句子级 BERT 编码进行处理,再输入依存句法分析器。

实验结果

研究问题

  • RQ1简单的预训练多语言 BERT 嵌入线性变换能否实现强大的零样本跨语言依存句法分析性能?
  • RQ2在性能、数据效率和训练成本方面,CLBT 与 SOTA 跨语言模型(如 XLM)相比如何?
  • RQ3该变换在多大程度上保留了跨语言的词义区分?
  • RQ4CLBT 的性能对平行训练数据规模的敏感程度如何?
  • RQ5CLBT 能否在极少资源下有效扩展到新的语种对?

主要发现

  • 在 Universal Dependencies v2.2 测试集上,CLBT 实现了 77.85% 的平均 LAS,相比先前使用静态嵌入的 SOTA 方法绝对提升了 2.91%。
  • 尽管每种语言仅使用 10,000 组平行句(而 XLM 使用 0.2–13.1 百万组),CLBT 在四种语言中的三种(bg, da, sv)表现优于 XLM,且在法语上与之持平。
  • 与 XLM 相比,该方法所需训练数据和时间显著更少,训练仅需数小时而非大规模硬件上的数天。
  • t-SNE 可视化结果表明,CLBT 改进了跨语言对齐,同时保留了词义聚类,来自不同语言的同义词词元在共享空间中更接近。
  • 对于大多数语言,性能在仅 5,000 组平行句时即趋于饱和,甚至对日耳曼语和罗曼语等类型相近的语言,100 组句子也足够。
  • 基于 SVD 的 CLBT 变体在性能上与基于 GD 的方法相当,但训练速度显著更快,使其在快速部署中更具实用性。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。