[论文解读] Breaking Character: Are Subwords Good Enough for MRLs After All?
本文提出 TavBERT,一种基于字符级跨度而非子词的 BERT 风格掩码语言模型,旨在评估字符级建模是否能提升词形丰富的语言(MRLs)的性能。尽管在词形任务上表现微弱提升,但子词模型在希伯来语、土耳其语和阿拉伯语的命名实体识别与问答等语义任务上显著优于 TavBERT,表明子词分词在 MRLs 中仍是强有力的归纳偏置。
Large pretrained language models (PLMs) typically tokenize the input string into contiguous subwords before any pretraining or inference. However, previous studies have claimed that this form of subword tokenization is inadequate for processing morphologically-rich languages (MRLs). We revisit this hypothesis by pretraining a BERT-style masked language model over character sequences instead of word-pieces. We compare the resulting model, dubbed TavBERT, against contemporary PLMs based on subwords for three highly complex and ambiguous MRLs (Hebrew, Turkish, and Arabic), testing them on both morphological and semantic tasks. Our results show, for all tested languages, that while TavBERT obtains mild improvements on surface-level tasks à la POS tagging and full morphological disambiguation, subword-based PLMs achieve significantly higher performance on semantic tasks, such as named entity recognition and extractive question answering. These results showcase and (re)confirm the potential of subword tokenization as a reasonable modeling assumption for many languages, including MRLs.
研究动机与目标
- 调查先前假设的子词分词是否不足以应对词形丰富的语言(MRLs)
- 评估基于字符的掩码语言模型(TavBERT)与子词基 BERT 模型在 MRLs 上的性能表现
- 在希伯来语、土耳其语和阿拉伯语中,对比 TavBERT 与子词模型在词形句法与语义下游任务上的表现
- 评估字符级预训练是否能更好地捕捉 MRLs 中的词形模式
- 重新评估子词分词会损害预训练语言模型在 MRLs 中性能的假设
提出的方法
- 使用原始字符序列上的掩码语言建模(MLM)目标,预训练一个 BERT 风格的 Transformer 编码器
- 使用泊松分布确定跨度长度,对字符跨度(而非子词)进行随机掩码,平均掩码 15% 的序列
- 使用 [MASK] 标记预测被掩码跨度中的原始字符,仅通过 MLM 目标进行训练,不包含下一句预测
- 使用字符频率定义词汇表,覆盖语料库 99.93% 的内容,在希伯来语、土耳其语和阿拉伯语的单语 OSCAR 语料库上训练 TavBERT
- 在下游任务(包括词性标注、词形消歧、命名实体识别和抽取式问答)上微调 TavBERT
- 在相同基准上,将 TavBERT 的性能与子词基模型(mBERT、HeBERT、BERTurk、AraBERT)进行对比
实验结果
研究问题
- RQ1在词形丰富的语言中,字符级预训练(TavBERT)是否在词形任务上优于子词基模型?
- RQ2与子词基 BERT 模型相比,TavBERT 在完整词形消歧任务上的提升程度如何?
- RQ3在命名实体识别和问答等语义任务上,子词基模型与 TavBERT 的表现如何比较?
- RQ4子词分词是否足以作为建模 MRLs 词形丰富性的归纳偏置?
- RQ5在缺乏显式语言学先验的情况下,字符级模型能否学习复杂的词形模式?
主要发现
- 在词性标注任务上,TavBERT 与子词基模型表现相当,仅在部分语言中取得微弱改进
- 在完整词形消歧任务上,TavBERT 在 SPMRL 上比 mBERT 减少 25% 的错误,在 UD 上减少 39%,优于 mBERT,但与单语子词模型相比仍有显著差距
- 在命名实体识别任务上,TavBERT 表现逊于子词模型:希伯来语上 F1 为 81.54(AlephBERT 为 84.91),土耳其语上 F1 为 91.19(BERTurk 为 93.57),阿拉伯语上 F1 为 79.45(AraBERT 为 83.48)
- 在抽取式问答任务上,TavBERT 表现存在显著差距:希伯来语上 F1 为 48.7 / EM 为 29.1(AraBERT 为 49.6 / 26.0),土耳其语上 F1 为 61.7 / EM 为 46.7(BERTurk 为 78.2 / 61.1),阿拉伯语上 F1 为 60.0 / EM 为 45.9(AraBERT 为 83.5 / 71.1)
- 在所有三种语言中,子词基模型在语义任务上始终优于 TavBERT,表明其具备更强的语义表征学习能力
- 结果表明,子词分词是 MRLs 中合理且有效的归纳偏置,与先前认为其不足的主张相反
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。