[论文解读] Transformer-based Models of Text Normalization for Speech Applications
本文评估了用于语音应用中文本归一化的基于Transformer的模型,特别聚焦于文本到语音合成,比较了seq2seq和两阶段架构的变体。主要发现是,在两阶段模型中微调BERT编码器可实现最佳性能,在标准数据集上将句子错误率降低至1.42%,在人工标注数据集上为5.59%,优于RNN基线模型和原始Transformer模型。
Text normalization, or the process of transforming text into a consistent, canonical form, is crucial for speech applications such as text-to-speech synthesis (TTS). In TTS, the system must decide whether to verbalize "1995" as "nineteen ninety five" in "born in 1995" or as "one thousand nine hundred ninety five" in "page 1995". We present an experimental comparison of various Transformer-based sequence-to-sequence (seq2seq) models of text normalization for speech and evaluate them on a variety of datasets of written text aligned to its normalized spoken form. These models include variants of the 2-stage RNN-based tagging/seq2seq architecture introduced by Zhang et al. (2019), where we replace the RNN with a Transformer in one or more stages, as well as vanilla Transformers that output string representations of edit sequences. Of our approaches, using Transformers for sentence context encoding within the 2-stage model proved most effective, with the fine-tuned BERT encoder yielding the best performance.
研究动机与目标
- 评估基于Transformer的架构在语音应用中文本归一化的有效性,特别是文本到语音(TTS)合成。
- 探究预训练模型(如BERT)是否在性能上优于从零开始训练或使用标准Transformer。
- 在真实世界文本归一化数据集上,比较单阶段seq2seq、基于编辑的表示方法和两阶段模型等不同架构设计。
- 分析语义类别标记错误对整体系统性能的影响,并探索缓解方法。
- 评估神经模型在处理不可恢复错误方面的局限性,特别是在训练数据有限或包含参考错误时。
提出的方法
- 采用两阶段架构,第一阶段对语义类别(如数字、日期)进行分类,第二阶段使用基于Transformer的seq2seq模型执行归一化。
- 在原始两阶段模型中,用Transformer编码器替代RNN以编码句子上下文,评估微调和冻结BERT变体的性能。
- 实验采用完整字符串输出和基于编辑的表示方法,使用pos*标记表示源文本片段的替换,以减少对未更改字符的复制需求。
- 使用标准交叉熵损失进行训练,并采用束搜索推理,训练数据来自两个数据集:自动生成的(标准)和人工标注的(人工)。
- 使用黄金标记(经人工验证的语义类别边界)来隔离并测量分类错误对整体性能的影响。
- 使用句子错误率(SER)作为主要指标,比较不同模型的性能,并通过消融实验分析微调与冻结BERT以及输入表示类型的影响。
实验结果
研究问题
- RQ1基于Transformer的seq2seq模型在TTS应用中的文本归一化任务中,与RNN基线模型相比表现如何?
- RQ2在两阶段归一化流程中引入预训练BERT编码器是否能提升性能,优于从零开始训练或使用标准Transformer?
- RQ3基于编辑的表示与完整字符串输出表示对模型鲁棒性和错误率有何影响?
- RQ4语义类别标记错误在多大程度上导致整体系统错误?黄金标记是否能显著减少这些错误?
- RQ5即使使用先进的模型(如微调BERT),不可恢复错误(如将简单类别误判为复杂类别)是否仍然普遍存在?
主要发现
- 在两阶段模型中微调BERT编码器,在标准数据集上实现了最低的句子错误率1.42%,在人工数据集上为5.59%,优于所有其他测试模型。
- 使用黄金语义类别标记的两阶段模型,其错误率降低了61%,表明分类错误是主要失败原因。
- 原始单阶段Transformer模型表现较差,原因在于对罕见位置标记(pos*)的暴露不足,尤其是在训练数据有限时。
- 采用基于编辑的表示方法并使用标记化输入的模型,在标准数据集上SER为2.04%,在人工数据集上为5.65%,表现中等但鲁棒性低于两阶段BERT方法。
- 即使使用最佳模型,仍存在不可恢复的错误,如将'7/8 inch'误判为'five eighth',凸显了归一化任务中的持续挑战。
- 本研究证实,自动生成数据集中存在的参考错误(如'TIME' → 't i m e')以及人工标注中评分者不一致性,仍是可靠评估和模型改进的重大障碍。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。