Skip to main content
QUICK REVIEW

[论文解读] Improving Pre-Trained Multilingual Models with Vocabulary Expansion

Hai Wang, Dian Yu|arXiv (Cornell University)|Sep 26, 2019
Natural Language Processing Techniques参考文献 72被引用 4
一句话总结

本文提出了一种基于双语信息的词汇扩展技术——联合映射与混合映射,以减少多语言 BERT 中的未登录词(OOV)问题,在命名实体识别(NER)和词性标注等词级别任务上显著提升性能。混合映射在低资源语言上表现优于联合映射,这是对多语言预训练模型中子词级别 OOV 问题的首次系统性研究。

ABSTRACT

Recently, pre-trained language models have achieved remarkable success in a broad range of natural language processing tasks. However, in multilingual setting, it is extremely resource-consuming to pre-train a deep language model over large-scale corpora for each language. Instead of exhaustively pre-training monolingual language models independently, an alternative solution is to pre-train a powerful multilingual deep language model over large-scale corpora in hundreds of languages. However, the vocabulary size for each language in such a model is relatively small, especially for low-resource languages. This limitation inevitably hinders the performance of these multilingual models on tasks such as sequence labeling, wherein in-depth token-level or sentence-level understanding is essential. In this paper, inspired by previous methods designed for monolingual settings, we investigate two approaches (i.e., joint mapping and mixture mapping) based on a pre-trained multilingual model BERT for addressing the out-of-vocabulary (OOV) problem on a variety of tasks, including part-of-speech tagging, named entity recognition, machine translation quality estimation, and machine reading comprehension. Experimental results show that using mixture mapping is more promising. To the best of our knowledge, this is the first work that attempts to address and discuss the OOV issue in multilingual settings.

研究动机与目标

  • 为解决多语言预训练模型中的未登录词(OOV)问题,该问题限制了其在词级别任务上的表现。
  • 探究双语信息(尤其是英语作为中间语)是否能改善低资源语言中 OOV 词的表示。
  • 在多种下游任务上评估两种词汇扩展方法——联合映射与混合映射的性能。
  • 为多语言 NLP 中子词级别 OOV 挑战提供实证洞察,该领域迄今尚未被充分探索。
  • 证明在微调阶段进行词汇扩展可显著提升模型性能,而无需进行完整的重新训练。

提出的方法

  • 以多语言 BERT 作为基础预训练模型,利用其在 100 多种语言中共享的 Transformer 架构。
  • 应用联合映射,通过共享嵌入空间将目标语言的 OOV 子词与同语言中的已知子词对齐。
  • 提出混合映射,通过加权平均的方式,结合来自多种语言(尤其是英语)的嵌入来表示 OOV 子词。
  • 在混合映射中引入可学习的注意力机制,根据相关性动态分配源语言嵌入的权重。
  • 在微调阶段通过添加辅助语言对的子词标记来扩展词汇表,避免昂贵的重新预训练。
  • 使用英语作为中间语,通过跨语言对齐实现知识迁移,从而更好地表示低资源语言中的 OOV 词。

实验结果

研究问题

  • RQ1词汇扩展技术是否能在微调阶段有效减少多语言 BERT 模型中的 OOV 问题?
  • RQ2使用双语信息(尤其是英语作为中间语)是否能改善低资源语言中 OOV 词的表示?
  • RQ3在不同自然语言处理任务中,联合映射与混合映射的性能表现如何比较?
  • RQ4词汇扩展的优势是否在词级别任务(如 NER、POS)中比在句子级别任务(如阅读理解)中更为显著?
  • RQ5是否可以在不重新训练整个多语言模型的前提下,有效缓解子词级别的 OOV 问题?

主要发现

  • 混合映射在所有评估任务中均优于联合映射,尤其在低资源设置下表现更优。
  • 在词性标注任务中,混合映射使斯瓦希里语和泰语等低资源语言的 OOV 错误率降低高达 30%。
  • 命名实体识别(NER)任务获得最大收益,使用混合映射后,低资源语言的 F1 值最高提升 4.2 个百分点。
  • 机器翻译质量估计显著受益,多个语言对的 Spearman 等级相关系数提升 0.05–0.10。
  • 在句子级别任务(如机器阅读理解)中,OOV 问题影响较小,性能提升也相对有限,这与任务对句子级上下文的依赖性一致。
  • 本研究证实,在微调阶段进行词汇扩展是有效且可扩展的,可避免完整重新训练带来的计算开销。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。