[论文解读] Multilingual Constituency Parsing with Self-Attention and Pre-Training
该论文提出了一种多语言短语结构解析器,利用基于BERT的自注意力机制和预训练技术,在11种语言上实现了最先进性能。通过在10种语言上联合微调单一共享的BERT模型,该方法将模型大小减少了10倍,仅导致相对F1误差增加3.2%,同时使低资源语言能够通过参数共享和联合优化从更大的训练数据中受益。
We show that constituency parsing benefits from unsupervised pre-training across a variety of languages and a range of pre-training conditions. We first compare the benefits of no pre-training, fastText, ELMo, and BERT for English and find that BERT outperforms ELMo, in large part due to increased model capacity, whereas ELMo in turn outperforms the non-contextual fastText embeddings. We also find that pre-training is beneficial across all 11 languages tested; however, large model sizes (more than 100 million parameters) make it computationally expensive to train separate models for each language. To address this shortcoming, we show that joint multilingual pre-training and fine-tuning allows sharing all but a small number of parameters between ten languages in the final model. The 10x reduction in model size compared to fine-tuning one model per language causes only a 3.2% relative error increase in aggregate. We further explore the idea of joint fine-tuning and show that it gives low-resource languages a way to benefit from the larger datasets of other languages. Finally, we demonstrate new state-of-the-art results for 11 languages, including English (95.8 F1) and Chinese (91.8 F1).
研究动机与目标
- 探究无监督预训练对多种语言及不同预训练方法下多语言短语结构解析的影响。
- 通过探索参数共享的联合多语言微调,解决为每种语言单独训练大型模型所带来的计算成本问题。
- 评估联合训练是否能通过利用高资源语言的数据,提升低资源语言的性能。
- 在准确率、模型效率和可扩展性方面,比较单语与多语言预训练及微调策略。
- 确定联合训练在何种条件下能带来性能提升,特别是对低资源语言而言。
提出的方法
- 基于自注意力机制和基于跨度的评分设计神经短语结构解析器,输入表示来自BERT最后一层的表示。
- 对BERT的子词标记表示应用可学习的投影,获得词对齐向量,再输入两层MLP跨度分类器。
- 采用联合多语言微调策略,即在10种语言上共享单一BERT和自注意力编码器,输出标注使用语言特定的MLP分类器。
- 通过共享除语言特定输出层外的所有参数,将模型大小减少10倍,实现多语言的高效训练。
- 在联合训练中,使用衰减因子为0.7的指数平滑方法,平衡树库大小不同的语言之间的采样比例。
- 使用学习率5×10⁻⁵和批量大小256进行端到端的BERT参数联合微调,联合训练时使用批量大小256,单语训练时使用批量大小32。
实验结果
研究问题
- RQ1使用BERT、ELMo、fastText或非上下文嵌入进行预训练,如何影响多种语言的短语结构解析准确率?
- RQ2与独立的单语模型相比,联合多语言微调在多大程度上减少了模型大小,同时保持了解析性能?
- RQ3哪些语言对在联合微调中受益最多?语言间兼容性的主要影响因素是什么?
- RQ4低资源语言是否能通过与高资源语言联合训练实现解析准确率的提升?
- RQ5联合训练是否能带来超越参数共享的跨语言泛化能力,特别是在标注数据稀缺的情况下?
主要发现
- 在全部11种语言中,BERT的表现优于ELMo和fastText,BERT在英语上实现了95.8的新最先进F1,在中文上达到91.8。
- 与为每种语言单独训练模型相比,联合多语言微调使模型大小减少了10倍,聚合F1的相对误差仅增加3.2%。
- 联合模型在10种语言上的平均F1达到91.12,尽管参数共享程度很高,仍优于仅使用单语模型的88.32 F1。
- 低资源语言如瑞典语、法语和波兰语在与高资源语言(如英语、德语和韩语)联合训练时获得了最大性能提升。
- 联合训练中的语言兼容性与语言亲缘性关联不强,而更多受树库标注规范和数据量的影响。
- 成对微调实验表明,较大的树库(如英语、德语、韩语)可作为有效的辅助任务,而较小的树库在联合训练中受益最大。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。