Skip to main content
QUICK REVIEW

[论文解读] MVP-BERT: Redesigning Vocabularies for Chinese BERT and Multi-Vocab Pretraining

Wei Zhu|arXiv (Cornell University)|Nov 17, 2020
Topic Modeling参考文献 28被引用 4
一句话总结

本文提出MVP-BERT,一种通过中文分词与子词分词(seg_tok)重新设计中文BERT词表的新方法,并引入三种多词表预训练(MVP)策略——分层式、成对式与目标导向式,以增强模型表达能力。实验表明,seg_tok在句子级任务上提升了性能与效率,而MVP策略(尤其是MVP_obj与MVP_pair)显著提升了序列标注任务(如NER)的性能,其中MVP_obj在训练时间不足一半的情况下实现了接近最优的性能表现。

ABSTRACT

Despite the development of pre-trained language models (PLMs) significantly raise the performances of various Chinese natural language processing (NLP) tasks, the vocabulary for these Chinese PLMs remain to be the one provided by Google Chinese Bert \cite{devlin2018bert}, which is based on Chinese characters. Second, the masked language model pre-training is based on a single vocabulary, which limits its downstream task performances. In this work, we first propose a novel method, \emph{seg\_tok}, to form the vocabulary of Chinese BERT, with the help of Chinese word segmentation (CWS) and subword tokenization. Then we propose three versions of multi-vocabulary pretraining (MVP) to improve the models expressiveness. Experiments show that: (a) compared with char based vocabulary, \emph{seg\_tok} does not only improves the performances of Chinese PLMs on sentence level tasks, it can also improve efficiency; (b) MVP improves PLMs' downstream performance, especially it can improve \emph{seg\_tok}'s performances on sequence labeling tasks.

研究动机与目标

  • 为解决中文BERT中基于字符的词表所导致的语义学习与效率瓶颈问题。
  • 探索兼顾词级语义与子词灵活性的替代性词表设计,以提升下游任务性能。
  • 开发多词表预训练(MVP)策略,通过在预训练阶段整合多个词表,增强模型表达能力。
  • 在多样化的中文NLP基准上评估seg_tok与MVP策略的有效性,尤其关注序列标注任务的表现。
  • 通过分析性能与训练成本之间的权衡,提供一种资源高效的单词表模型替代方案。

提出的方法

  • 提出seg_tok,一种结合中文分词(CWS)与子词分词的混合词表构建方法,生成比字符级分词更具语义意义的词表。
  • 引入MVP_hier,一种分层式多词表策略,先将字符嵌入聚合为词级表示,再输入Transformer编码器。
  • 设计MVP_pair,一种双编码器方法,采用共享参数,同时使用两种不同词表(如字符与seg_tok)进行掩码语言建模,损失按系数λ加权。
  • 开发MVP_obj,一种单编码器策略,将粗粒度词表(如seg_tok)作为辅助目标,用于从子词表示中预测完整词语,从而增强语义学习。
  • 在预训练阶段采用整词掩码机制,确保多字词的连贯预测,提升与语言单位的一致性。
  • 使用相对重要性系数λ平衡MVP_pair中不同词表的损失贡献,支持对最优权衡的消融实验。

实验结果

研究问题

  • RQ1基于分词结果的词表(seg_tok)是否能在中文BERT的句子级NLP任务中超越标准的字符级词表?
  • RQ2与单词表预训练相比,多词表预训练(MVP)如何提升中文PLM的表达能力与下游性能?
  • RQ3不同MVP策略——分层式、成对式与目标导向式——对模型准确率与训练效率的影响如何?
  • RQ4相对重要性系数λ如何影响MVP_pair的性能?不同下游任务的最优设置为何?
  • RQ5MVP_obj能否在显著降低训练成本的前提下,实现接近MVP_pair的性能表现,尤其在资源受限场景下?

主要发现

  • seg_tok词表在句子级任务(如LCQMC、MSRA)上相比字符级BERT性能最高提升2.46%,且因序列更短而具备更快的推理速度。
  • MVP_obj采用(char, seg_tok)组合在LCQMC上达到86.10%准确率,在NER上达到73.95%,优于单词表模型,并接近全集成模型的性能。
  • MVP_pair在双编码器(e, ftc)设置下在LCQMC上达到87.96%,在MSRA上达到80.05%,表明集成训练显著提升了性能,尤其在NER任务上。
  • 从粗到细的MVP_pair(char → seg_tok)在NER任务上优于从细到粗(seg_tok → char),表明粗粒度监督有助于学习更鲁棒的表示。
  • MVP_obj在λ=2.0时,以不足一半的训练时间即实现接近MVP_pair的性能,使其在低资源场景下成为更高效的替代方案。
  • 当λ超过1.0时,MVP_pair在NER任务上性能下降,但在句子级任务上性能提升,表明最优λ值具有任务依赖性。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。