[论文解读] Pretraining without Wordpieces: Learning Over a Vocabulary of Millions of Words
本文提出 WordBERT,一种基于整个词汇表(而非子词单元,如 wordpieces)进行训练的 BERT 风格模型,采用基于采样的训练策略以应对大规模词汇表。该模型在完形填空测试和机器阅读理解任务中取得显著提升,且在 POS 标注、名词短语切分和命名实体识别任务中持续优于 BERT,在中文自然语言处理任务中表现强劲,尽管词汇量更大,推理速度仍与 BERT 相当。
The standard BERT adopts subword-based tokenization, which may break a word into two or more wordpieces (e.g., converting "lossless" to "loss" and "less"). This will bring inconvenience in following situations: (1) what is the best way to obtain the contextual vector of a word that is divided into multiple wordpieces? (2) how to predict a word via cloze test without knowing the number of wordpieces in advance? In this work, we explore the possibility of developing BERT-style pretrained model over a vocabulary of words instead of wordpieces. We call such word-level BERT model as WordBERT. We train models with different vocabulary sizes, initialization configurations and languages. Results show that, compared to standard wordpiece-based BERT, WordBERT makes significant improvements on cloze test and machine reading comprehension. On many other natural language understanding tasks, including POS tagging, chunking and NER, WordBERT consistently performs better than BERT. Model analysis indicates that the major advantage of WordBERT over BERT lies in the understanding for low-frequency words and rare words. Furthermore, since the pipeline is language-independent, we train WordBERT for Chinese language and obtain significant gains on five natural language understanding datasets. Lastly, the analyse on inference speed illustrates WordBERT has comparable time cost to BERT in natural language understanding tasks.
研究动机与目标
- 为解决 BERT 中子词分词带来的局限性,例如词语表示碎片化以及通过完形填空任务难以预测多词组合的问题。
- 探究是否直接在大规模完整词汇表上训练 BERT 风格模型,可提升上下文表示学习的效果。
- 评估词级别预训练在多种自然语言处理任务和语言(包括英语和中文)上的性能表现。
- 分析 WordBERT 是否相比 BERT 更好地捕捉低频词和罕见词的表示。
- 证明即使在词汇量高达 100 万的情况下,词级别预训练在大规模场景下仍具备可行性与高效性。
提出的方法
- 使用词级别词汇表而非子词单元训练 BERT 风格模型,从而消除 wordpiece 分词机制。
- 采用基于采样的训练策略,以降低预训练阶段的计算成本,每批次仅更新部分词嵌入参数。
- 使用标准 Transformer 架构,结合掩码语言建模和下一句预测目标,但针对完整词语输入进行适配。
- 实验不同词汇量(50 万、100 万)及初始化策略,包括使用预训练的 GloVe 嵌入。
- 使用大规模中文词汇表训练专用的中文 WordBERT 模型,以评估跨语言有效性。
- 在推理阶段使用词典查找进行词嵌入获取,确保即使在大规模词汇表下性能开销也极低。
实验结果
研究问题
- RQ1在下游自然语言处理任务中,基于完整词汇表训练的 BERT 风格模型是否能超越标准子词基 BERT?
- RQ2词级别预训练是否能提升模型在完形填空任务中对复合词或罕见词的预测能力?
- RQ3与 BERT 相比,WordBERT 在低频词和罕见词上的表现如何,特别是在零样本探测场景下?
- RQ4该词级别预训练方法在不同语言(如英语和中文)上是否具备可扩展性与高效性?
- RQ5WordBERT 的更大词汇量是否导致推理时间增加,还是与 BERT 相当?
主要发现
- WordBERT 在完形填空测试和机器阅读理解任务中取得显著提升,大幅超越 BERT。
- 在 POS 标注、名词短语切分和命名实体识别任务中,WordBERT 在多个数据集上均持续获得高于 BERT 的 F1 分数。
- 探测分析显示,WordBERT 生成的预测更具多样性且语义更合理,尤其在罕见词和低频词上表现更优;而 BERT 倾向于生成常见词或子词。
- 中文 WordBERT 模型在 CLUE 基准测试中取得显著提升,证明该方法在低资源和形态复杂的语言中同样有效。
- 尽管词嵌入参数最多达 7.68 亿,WordBERT 仍通过高效的基于词典的查找机制和更短的输入序列,保持与 BERT 相当的推理速度。
- 基于采样的训练策略有效降低了预训练阶段的计算成本,使在大规模词级别词汇表上训练成为可能,且无显著性能开销。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。