QUICK REVIEW
[论文解读] Generating Segment Durations in a Text-To-Speech System: A Hybrid Rule-Based/Neural Network Approach
Gerald Corrigan, Noel Massey|ArXiv.org|Nov 24, 1998
Speech and dialogue systems参考文献 3被引用 9
一句话总结
本文提出一种混合方法,结合基于规则的系统与神经网络,以生成文本到语音(TTS)系统中的音段时长。通过将规则触发的特征整合到神经网络中,该方法提高了时长预测的准确性,使合成语音在听觉感知上与自然语音相当。
ABSTRACT
A combination of a neural network with rule firing information from a rule-based system is used to generate segment durations for a text-to-speech system. The system shows a slight improvement in performance over a neural network system without the rule firing information. Synthesized speech using segment durations was accepted by listeners as having about the same quality as speech generated using segment durations extracted from natural speech.
研究动机与目标
- 解决在文本到语音系统中生成自然音段时长的挑战。
- 在纯神经网络模型的基础上,进一步提升时长预测的准确性。
- 将符号化的语言规则与数据驱动的神经网络相结合,以增强语调输出质量。
- 通过所提出的时长生成方法,评估合成语音的感知质量。
- 证明混合系统在时长建模方面可实现接近自然语音的性能。
提出的方法
- 使用基于规则的系统提取影响音段时长的语言学特征(例如:词性、音节位置、重音)。
- 将基于规则系统的输出作为附加输入特征,输入到前馈神经网络中。
- 在包含自然语音的文本及其对应音段时长的数据集上训练神经网络。
- 将基于规则的触发信号与神经网络的预测结果相结合,生成最终的时长估计值。
- 将训练好的混合模型应用于未见文本输入,在TTS系统中预测时长。
- 在拼接式或参数化TTS系统中使用预测的时长,合成语音。
实验结果
研究问题
- RQ1将基于规则的语言学特征整合到神经网络中,是否能提升其在音段时长预测中的性能?
- RQ2与独立的神经网络相比,混合的基于规则/神经网络系统在时长估计方面表现如何?
- RQ3使用混合系统生成的时长所合成的语音,在自然度方面与真人录音的语音有多接近?
- RQ4基于规则系统中哪些特定语言学特征对时长预测的贡献最为显著?
- RQ5增加符号化规则是否能减少神经时长建模对大规模训练数据集的依赖?
主要发现
- 与仅使用神经网络相比,混合系统在时长预测准确性上实现了微小但可测量的提升。
- 听者对使用混合系统生成时长的合成语音的评价,其质量与从自然语音中提取时长生成的语音相当。
- 规则触发特征的整合增强了神经网络对语音语调变化的建模能力。
- 基于规则的组件提供了可解释性,并捕捉了纯神经模型可能遗漏的语音和句法上下文信息。
- 该系统表明,将符号知识与神经学习相结合,可同时提升性能与感知质量。
- 结果表明,混合架构能有效平衡TTS系统中数据驱动学习与语言先验知识。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。