Skip to main content
QUICK REVIEW

[论文解读] Locating Language-Specific Information in Contextualized Embeddings

Sheng Liang, Philipp Dufter|arXiv (Cornell University)|Sep 16, 2021
Topic Modeling参考文献 15被引用 4
一句话总结

本文识别并分析了多语言上下文嵌入中的语言特异性信息,表明其分布在多个维度中,并可投影到维度数约等于语言数量的线性子空间中。通过使用 DensRay 和 LDA 进行线性投影,作者发现语言特异性信息在低层最易分离,并提出一种活动正则化方法(L-DAR),该方法在命名实体识别(NER)和词性标注任务中提升了零样本跨语言迁移性能。

ABSTRACT

Multilingual pretrained language models (MPLMs) exhibit multilinguality and are well suited for transfer across languages. Most MPLMs are trained in an unsupervised fashion and the relationship between their objective and multilinguality is unclear. More specifically, the question whether MPLM representations are language-agnostic or they simply interleave well with learned task prediction heads arises. In this work, we locate language-specific information in MPLMs and identify its dimensionality and the layers where this information occurs. We show that language-specific information is scattered across many dimensions, which can be projected into a linear subspace. Our study contributes to a better understanding of MPLM representations, going beyond treating them as unanalyzable blobs of information.

研究动机与目标

  • 探究多语言预训练语言模型(MPLMs)中语言特异性信息的编码位置与方式,特别是其是否为语言无关,或分散于各维度中。
  • 确定 MPLMs 中语言特异性子空间的维度,并识别该信息最显著的网络层。
  • 评估在微调过程中保留语言特异性信息是否能提升零样本跨语言迁移性能。
  • 提出并验证一种活动正则化方法(L-DAR),以在微调过程中鼓励保留语言特异性信息。

提出的方法

  • 作者采用两种线性投影方法——DensRay 和线性判别分析(LDA)——以定位多语言 BERT(mBERT)表示中的语言特异性子空间。
  • DensRay 通过正交变换最大化嵌入空间中不同语言之间的距离,同时最小化同一语言内部的距离。
  • LDA 利用类别中心与总体均值,识别类间具有判别性的方向,采用非正交变换。
  • 两种方法的目标函数中,语言特异性子空间的维度由矩阵的秩决定,其上界接近语言数量。
  • 提出一种活动正则化(L-DAR),在微调过程中将学习到的投影应用于隐藏表示,以保留语言特异性信息。
  • 实验在探针任务(语言识别、语言类型学、语言相似性)和下游 NLP 任务(词性标注、命名实体识别)上进行,采用零样本跨语言迁移设置。

实验结果

研究问题

  • RQ1在模型架构中,语言特异性信息最集中于何处——在维度和层中如何分布?
  • RQ2多语言上下文嵌入中语言特异性子空间的内在维度是多少?
  • RQ3在微调过程中保留语言特异性信息是否能提升零样本跨语言迁移性能?
  • RQ4不同线性投影方法(DensRay 与 LDA)在识别语言特异性子空间方面表现如何比较?

主要发现

  • mBERT 中的语言特异性信息虽分散于多个维度,但可投影到维度数约等于语言数量的线性子空间中。
  • 语言特异性信息在模型的低层最易分离,早期层中语言区分性更好。
  • 所提出的 L-DAR 正则化方法在零样本跨语言迁移中实现了小幅但稳定的性能提升,词性标注任务中 F1 提升 0.3%,多源词性标注任务中提升 0.5%,命名实体识别任务中下降 0.6%,表明其效果具有任务依赖性。
  • L-DAR 在零样本词性标注任务中优于基线 mBERT 的高层,表明在深层中更好地保留了语言特异性特征。
  • 语言特异性子空间维度的上界由语言数量决定,而非模型大小或架构。
  • DensRay 和 LDA 均能识别出有意义的语言特异性子空间,但 LDA 在下游任务中表现略优,因其在类别分离中使用了全局均值。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。