Skip to main content
QUICK REVIEW

[论文解读] Cross-lingual Word Sense Disambiguation using mBERT Embeddings with Syntactic Dependencies

Xingran Zhu|arXiv (Cornell University)|Dec 9, 2020
Natural Language Processing Techniques参考文献 13被引用 6
一句话总结

本文提出了一种跨语言词义消歧(WSD)系统,通过拼接目标词、核心词和依存词的嵌入向量,将句法依存关系融入mBERT嵌入表示。尽管在单语英语数据上达到了63.69%的准确率,但该方法在跨语言英语-法语评估中表现欠佳(准确率为37.50%),原因在于高维嵌入向量和跨语言泛化能力差,凸显了在多语言WSD任务中扩展句法增强BERT模型所面临的挑战。

ABSTRACT

Cross-lingual word sense disambiguation (WSD) tackles the challenge of disambiguating ambiguous words across languages given context. The pre-trained BERT embedding model has been proven to be effective in extracting contextual information of words, and have been incorporated as features into many state-of-the-art WSD systems. In order to investigate how syntactic information can be added into the BERT embeddings to result in both semantics- and syntax-incorporated word embeddings, this project proposes the concatenated embeddings by producing dependency parse tress and encoding the relative relationships of words into the input embeddings. Two methods are also proposed to reduce the size of the concatenated embeddings. The experimental results show that the high dimensionality of the syntax-incorporated embeddings constitute an obstacle for the classification task, which needs to be further addressed in future studies.

研究动机与目标

  • 通过将句法依存关系整合到mBERT嵌入中,提升跨语言词义消歧性能。
  • 探究通过依存句法分析获得的句法关系是否能增强WSD任务中的上下文词表示。
  • 评估句法增强嵌入在单语和跨语言WSD任务中的性能表现。
  • 通过尺寸缩减技术,解决拼接嵌入引入的维度灾难问题。
  • 评估在英语数据上训练的模型在英语-法语等低资源跨语言设置下的泛化能力。

提出的方法

  • 为每句话生成依存句法树,以识别歧义词与其核心词和依存词之间的句法关系。
  • 将歧义词、其核心词和依存词的mBERT嵌入向量进行拼接,形成单一高维输入向量。
  • 探索两种降维方法:(1) 仅保留目标词和核心词嵌入(仅核心词方法);(2) 对三个嵌入向量进行逐元素相乘。
  • 通过将目标词嵌入乘以2来增强其在最终表示中的影响。
  • 在8,000对带有词义标注的英语句子对上训练多层感知机(MLP)分类器。
  • 使用相同的预处理和嵌入拼接方式,在跨语言英语-法语测试数据集上评估训练好的模型。

实验结果

研究问题

  • RQ1将句法依存关系整合到mBERT嵌入中,能否提升跨语言词义消歧的性能?
  • RQ2拼接嵌入的高维性对WSD任务分类准确率有何影响?
  • RQ3如仅核心词选择或逐元素相乘等降维技术,是否能保留WSD任务中必要的语义和句法信息?
  • RQ4通过放大目标词嵌入是否能通过强调其在词义区分中的作用,提升消歧性能?
  • RQ5在单语英语数据上训练的模型,在英语-法语等跨语言设置下的泛化能力如何?

主要发现

  • 拼接嵌入方法在单语英语WSD任务上达到63.69%的测试准确率,优于未整合句法信息的基线mBERT模型。
  • 通过仅核心词方法和逐元素相乘进行降维后,性能下降,其中逐元素相乘方法准确率降至48.19%,表明关键信息丢失。
  • 将目标词嵌入乘以2后,准确率从63.69%降至63.19%,表明嵌入空间中的句法关系可能被扭曲。
  • 该模型在跨语言英语-法语评估中表现不佳,准确率仅为37.50%,表明其在跨语言场景下的泛化能力差。
  • 句法增强嵌入的高维性对有效分类构成显著障碍,未来工作需关注高效的表征学习方法。
  • 结果表明,尽管句法信息可被整合进mBERT,但当前的拼接与降维方法并不理想,可能需要更复杂的归一化或特征工程方法以实现多语言迁移。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。