Skip to main content
QUICK REVIEW

[论文解读] Unified Mandarin TTS Front-end Based on Distilled BERT Model

Yang Zhang, Liqun Deng|arXiv (Cornell University)|Dec 31, 2020
Natural Language Processing Techniques参考文献 23被引用 15
一句话总结

本文提出了一种基于蒸馏 BERT 模型的统一普通话文本到语音(TTS)前端,采用多任务学习框架,联合预测语调结构与多音字消歧。蒸馏后的模型在仅保留基线系统 25% 参数量的情况下实现了最先进性能,使模型能够高效部署于移动设备,同时在多音字消歧任务上提升 0.31%,在 PPH F1 分数上提升 1.45%。

ABSTRACT

The front-end module in a typical Mandarin text-to-speech system (TTS) is composed of a long pipeline of text processing components, which requires extensive efforts to build and is prone to large accumulative model size and cascade errors. In this paper, a pre-trained language model (PLM) based model is proposed to simultaneously tackle the two most important tasks in TTS front-end, i.e., prosodic structure prediction (PSP) and grapheme-to-phoneme (G2P) conversion. We use a pre-trained Chinese BERT[1] as the text encoder and employ multi-task learning technique to adapt it to the two TTS front-end tasks. Then, the BERT encoder is distilled into a smaller model by employing a knowledge distillation technique called TinyBERT[2], making the whole model size 25% of that of benchmark pipeline models while maintaining competitive performance on both tasks. With the proposed the methods, we are able to run the whole TTS front-end module in a light and unified manner, which is more friendly to deployment on mobile devices.

研究动机与目标

  • 简化传统普通话 TTS 前端中复杂、多阶段的流水线结构,该结构存在级联误差与高计算成本的问题。
  • 将语调结构预测(PSP)与音素转写(G2P)统一为一个端到端可训练的单一模型。
  • 通过知识蒸馏技术减小模型规模,实现在不损失性能的前提下实现移动端高效部署。
  • 评估基于 BERT 的多任务学习在普通话 TTS 中联合执行 PSP 与 G2P 任务的有效性。

提出的方法

  • 使用预训练的中文 BERT 模型作为文本编码器,从原始字符输入中捕捉上下文语言特征。
  • 采用多任务学习,利用共享的 BERT 表示联合训练语调结构预测(PW、PPH、IPH)与多音字消歧任务。
  • 应用两阶段知识蒸馏技术(TinyBERT)将 BERT 编码器压缩为更小、更高效的模型。
  • 使用多层感知机(MLP)配合 Softmax 进行多音字分类,使用序列标注头进行语调边界预测。
  • 采用交叉熵损失函数训练多音字消歧任务,采用基于 F1 的优化策略训练语调结构预测任务。
  • 引入蒸馏损失,将教师 BERT 模型的知识迁移至更小的学⽣ TinyBERT 模型中。

实验结果

研究问题

  • RQ1能否通过统一的深度学习模型,在普通话 TTS 中联合完成语调结构预测与多音字消歧,并实现更高的效率?
  • RQ2与单任务或流水线方法相比,基于 BERT 的多任务学习在准确率与模型大小方面表现如何?
  • RQ3知识蒸馏在多大程度上可减小模型规模,同时保持 TTS 前端任务的性能?
  • RQ4蒸馏后的 BERT 基础模型是否在准确率与部署可行性方面均优于传统基于规则与统计的模型(如 WFST、CRF)?

主要发现

  • 蒸馏后的 TinyBERT-MTL 模型在多音字消歧任务上的准确率比基线 WFST 基础 G2P 模型高出 0.31%。
  • 与基准流水线系统相比,该模型在 PPH F1 分数上提升 1.45%,在 IPH F1 分数上提升 0.52%。
  • 最终蒸馏模型的大小仅为基准模型组合的 25%(47 MB 对比 199 MB),显著降低了存储与部署成本。
  • 尽管相比完整 BERT-MTL 模型存在轻微性能下降,但蒸馏模型在 CPU 上仅需 21.8 ms 的推理时间,仍保持了具有竞争力的性能表现。
  • 在微调后的 BERT 设置下,使用 MLP 进行多音字预测优于 BLSTM,表明从冻结的 BERT 编码器中学习到的上下文信息更优。
  • 在预测头中增加 CRF 层会轻微降低性能,表明 BERT 的上下文建模能力在标签转移建模方面优于 CRF。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。