[论文解读] An ASR Guided Speech Intelligibility Measure for TTS Model Selection
本文提出使用语音识别(ASR)解码生成语音与输入文本之间的电话错误率(PER)作为客观指标,以选择语音合成(TTS)模型,从而提升语音可懂度。该方法在主观评估中优于基于训练损失的模型选择方法,表明基于PER的模型选择能显著提升可懂度,尤其在目标文本类型为域外时效果更明显,且该方法在不同语言间具有普适性,尽管其验证基于印地语数据。
The perceptual quality of neural text-to-speech (TTS) is highly dependent on the choice of the model during training. Selecting the model using a training-objective metric such as the least mean squared error does not always correlate with human perception. In this paper, we propose an objective metric based on the phone error rate (PER) to select the TTS model with the best speech intelligibility. The PER is computed between the input text to the TTS model, and the text decoded from the synthesized speech using an automatic speech recognition (ASR) model, which is trained on the same data as the TTS model. With the help of subjective studies, we show that the TTS model chosen with the least PER on validation split has significantly higher speech intelligibility compared to the model with the least training-objective metric loss. Finally, using the proposed PER and subjective evaluation, we show that the choice of best TTS model depends on the genre of the target domain text. All our experiments are conducted on a Hindi language dataset. However, the proposed model selection method is language independent.
研究动机与目标
- 为解决在基于语音可懂度选择TTS模型时,缺乏客观、可扩展且与感知相关联的度量方法。
- 克服TTS模型选择中训练目标损失(如MSE)与人类感知的语音可懂度之间相关性差的问题。
- 探究输入文本与ASR解码生成语音之间的PER是否可作为可靠、语言无关的客观度量,用于面向可懂度的TTS模型选择。
- 评估模型选择如何依赖于目标领域文本的文本类型,特别是对比域内与域外测试集的表现。
提出的方法
- 使用固定声码器训练TTS系统,并在训练过程中改变前端模型。
- 使用在与TTS模型相同数据上预训练的ASR系统,将生成的语音解码为文本,并计算输入文本与解码文本之间的电话错误率(PER)。
- 在验证集上选择PER最低的TTS模型作为最终模型,而非选择训练损失最小的模型。
- 使用标准公式计算PER:PER = (S + D + I) / N,其中S、D、I分别表示替换、删除、插入错误,N为参考电话总数。
- 通过成对比较的主观听音测试,评估基于PER选择的模型与基于最小损失选择的模型在可懂度偏好上的差异。
- 在两个验证集上比较模型性能:一个为域内文本(与训练数据相似),另一个为域外文本(如新闻,包含57.1%未见词汇)。
实验结果
研究问题
- RQ1输入文本与ASR解码生成语音之间的PER是否可作为选择更高语音可懂度TTS模型的可靠客观度量?
- RQ2基于PER的模型选择是否在人类感知的语音可懂度方面优于基于训练损失的选择方法?
- RQ3最优TTS模型选择如何依赖于目标领域文本的文本类型,特别是在测试数据与训练数据不一致时?
- RQ4所提出的基于PER的度量方法在不同文本领域(如域内与域外)中是否有效且具有泛化能力?
主要发现
- 在验证集上选择PER最低的TTS模型,其语音可懂度显著高于选择训练损失最小的模型;在域内测试中,42.8%的参与者更偏好PER选择的模型,而损失选择的模型仅获28.1%的偏好。
- 对于域外文本(如新闻,包含57.1%未见词汇),最优模型在第550个训练周期基于PER选出,而最佳损失模型则在第710个周期选出,表明模型选择结果依赖于文本类型。
- PER选择的模型(MDL-PER-ID)正确检测了18,251个参考电话中的13,983个,而损失选择的模型(MDL-LOSS)仅检测到13,612个,显示出电话检测准确性的可测量提升。
- 在域外测试中,48.9%的参与者更偏好PER选择的模型(MDL-PER-OD),高于域内测试中的偏好比例,表明其优势在域外场景中更显著。
- 在直接对比中,50%的参与者认为PER选择的域外模型(MDL-PER-OD)与域内PER选择的模型(MDL-PER-ID)在可懂度上无明显差异,表明基于PER的选择方法能良好适应领域变化。
- 该方法在域内文本中提升了55种独特电话中的29种检测能力,在域外文本中提升了50种中的29种,仅少数电话出现轻微性能下降,证实了在可懂度相关性能上的持续改进。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。