[论文解读] Large Pre-Trained Models with Extra-Large Vocabularies: A Contrastive Analysis of Hebrew BERT Models and a New One to Outperform Them All
本文介绍了 AlephBERTGimmel,这是一种为现代希伯来语设计的新大型预训练语言模型,其词表规模达128K,显著大于以往的希伯来语 BERT 模型。通过对比分析,本文表明更大的词表可减少子词分词拆分,并在多个自然语言处理任务中提升性能,实现了形态分割、词性标注、命名实体识别、情感分析以及完整形态分析等任务的最先进结果。
We present a new pre-trained language model (PLM) for modern Hebrew, termed AlephBERTGimmel, which employs a much larger vocabulary (128K items) than standard Hebrew PLMs before. We perform a contrastive analysis of this model against all previous Hebrew PLMs (mBERT, heBERT, AlephBERT) and assess the effects of larger vocabularies on task performance. Our experiments show that larger vocabularies lead to fewer splits, and that reducing splits is better for model performance, across different tasks. All in all this new model achieves new SOTA on all available Hebrew benchmarks, including Morphological Segmentation, POS Tagging, Full Morphological Analysis, NER, and Sentiment Analysis. Subsequently we advocate for PLMs that are larger not only in terms of number of layers or training data, but also in terms of their vocabulary. We release the new model publicly for unrestricted use.
研究动机与目标
- 探究词表大小对现代希伯来语预训练语言模型性能的影响。
- 解决低资源语言(如希伯来语)中子词分词拆分带来的模型性能下降问题。
- 开发并评估一种具有超大词表的新型希伯来语 BERT 模型,以提升自然语言处理任务的准确性。
- 通过在多个任务上超越现有模型,建立希伯来语自然语言处理的新最先进基准。
提出的方法
- 设计并训练一种新型希伯来语 BERT 模型 AlephBERTGimmel,其词表规模达128,000个词,远大于标准希伯来语预训练模型。
- 在多个自然语言处理任务中,对 AlephBERTGimmel 与 mBERT、heBERT 和 AlephBERT 进行对比分析。
- 使用子词分词技术(字节对编码,BPE),并优化词表以最小化未登录词和子词拆分。
- 在一系列希伯来语自然语言处理基准上微调模型,包括形态分割、词性标注、命名实体识别、情感分析以及完整形态分析。
- 使用标准指标评估模型性能,并与先前的最先进模型进行比较。
- 公开发布训练好的模型,供无限制使用,以支持未来的研究与应用。
实验结果
研究问题
- RQ1增加词表大小如何影响希伯来语预训练语言模型中的子词分词拆分?
- RQ2更大的词表在下游希伯来语自然语言处理任务中能带来多大程度的性能提升?
- RQ3128K 词表的模型是否能在多个基准上超越现有的最先进希伯来语 BERT 模型?
- RQ4在希伯来语自然语言处理中,词表大小相比模型深度或训练数据规模,其相对影响如何?
- RQ5减少子词拆分是否能在多种不同的希伯来语自然语言处理任务中带来一致的性能提升?
主要发现
- AlephBERTGimmel 在所有评估的希伯来语自然语言处理基准上均达到最先进性能,包括形态分割、词性标注、完整形态分析、命名实体识别和情感分析。
- 由于词表更大,该模型相比以往模型表现出显著更少的子词分词拆分,且这种减少与性能提升密切相关。
- 减少子词拆分在所有测试任务中均带来可测量的准确率提升,验证了词表大小是低资源语言建模中的关键因素这一假设。
- 对比分析证实,更大的词表对性能提升的贡献,超过单纯增加模型深度或训练数据规模的影响。
- 该模型在所有基准上均优于 mBERT、heBERT 和 AlephBERT,确立了希伯来语自然语言处理的新最先进水平。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。