[论文解读] Hierarchical Representation of Prosody for Statistical Speech Synthesis
本文提出了一种基于连续小波变换(CWT)的无监督、分层韵律表征方法,用于统计语音合成,可联合检测韵律重音与边界。通过在尺度空间框架下分析基频、能量和时长,该方法在波士顿大学广播新闻语料库上的性能与使用声学、词汇和句法线索的监督式最先进方法相当,重音检测准确率与监督系统相差仅3-4%。
Prominences and boundaries are the essential constituents of prosodic structure in speech. They provide for means to chunk the speech stream into linguistically relevant units by providing them with relative saliences and demarcating them within coherent utterance structures. Prominences and boundaries have both been widely used in both basic research on prosody as well as in text-to-speech synthesis. However, there are no representation schemes that would provide for both estimating and modelling them in a unified fashion. Here we present an unsupervised unified account for estimating and representing prosodic prominences and boundaries using a scale-space analysis based on continuous wavelet transform. The methods are evaluated and compared to earlier work using the Boston University Radio News corpus. The results show that the proposed method is comparable with the best published supervised annotation methods.
研究动机与目标
- 开发一种统一的无监督框架,用于建模语音合成中的韵律重音与边界。
- 克服现有表征方案的局限性,这些方案将重音与边界检测分开处理,或需要人工标注的训练数据。
- 利用连续小波变换(CWT)的时间-频率尺度空间分析,实现分层韵律结构检测。
- 在波士顿大学广播新闻语料库上,使用客观指标评估该方法在重音与边界检测中的性能。
- 证明单一统一的信号表征可在无监督条件下同时建模感知上和音位上相关的韵律特征。
提出的方法
- 该方法对一维语音信号(f0、能量包络、时长)应用连续小波变换(CWT),生成类似感知层次的时-尺度表征。
- 通过尺度空间分析检测CWT语谱图中的局部极大值,识别韵律事件,如音节、韵律词以及重音/边界标记。
- 该方法引入一种间隙填充算法,以处理能量信号中的非声母或静音段,提高边界检测的鲁棒性。
- 通过在CWT分析前将f0、能量和时长合并为单一输入信号,实现特征融合,提升检测准确率。
- 该方法采用分层多尺度表征,与音系学和音位学韵律结构对齐,实现重音与边界事件的统一建模。
- 最终标注源自跨尺度的CWT响应中的局部极大值,经后处理以解决重叠或模糊事件。
实验结果
研究问题
- RQ1单一信号处理框架能否实现无监督统一表征,同时检测韵律重音与边界?
- RQ2所提出的基于CWT的方法在重音与边界检测中的性能与监督式最先进方法相比如何?
- RQ3与单一特征相比,组合声学特征(f0、能量、时长)在多大程度上提升了检测准确率?
- RQ4与传统的频谱图或MFCC表征相比,基于CWT的分层尺度空间分析是否能更好地捕捉韵律结构?
- RQ5该方法能否在不依赖人工标注训练数据的情况下,实现类人般的韵律结构检测?
主要发现
- 所提出的基于CWT的方法在重音检测中准确率与最佳监督方法相差仅3%,边界检测相差仅4%,后者使用了声学、词汇和句法线索。
- f0与时长的组合使重音检测准确率提升3%,边界检测准确率提升4%,表明时长具有强大的判别能力。
- 能量信号的间隙填充改善了边界检测,但对重音检测影响甚微,可能是因为对音节特征造成了过度平滑。
- 该方法显著优于无监督最先进方法,证明了分层尺度空间建模的有效性。
- 在CWT框架下联合建模f0、能量和时长,提供了统一表征,能够同时捕捉韵律的感知与音位特征。
- 结果表明,韵律重音与边界是单一潜在生成过程的体现,支持统一的理论框架。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。