Skip to main content
QUICK REVIEW

[论文解读] Modal locking between vocal fold and vocal tract oscillations: Simulations in time domain

Atte Aalto, Tiina Murtola|arXiv (Cornell University)|Jun 3, 2015
Speech Recognition and Synthesis参考文献 71被引用 4
一句话总结

本研究提出了一种时域计算模型,模拟人类言语装置中声带动力学与声道声学通过反馈耦合的机制,实现了对 [a] 和 [i] 元音滑音在 150–320 Hz 范围内的模拟。模型揭示了在 [i] 的第一声道共振频率(fR1)处,基频(fo)表现出稳健的模态锁定现象;而 [a] 的共振分数则引发扰动但无锁定,表明在有声言语中存在由反馈驱动的动力学耦合。

ABSTRACT

During voiced speech, the human vocal folds interact with the vocal tract acoustics. The resulting glottal source-resonator coupling has been observed using mathematical and physical models as well as in in vivo phonation. We propose a computational time-domain model of the full speech apparatus that, in particular, contains a feedback mechanism from the vocal tract acoustics to the vocal fold oscillations. It is based on numerical solution of ordinary and partial differential equations defined on vocal tract geometries that have been obtained by Magnetic Resonance Imaging. The model is used to simulate rising and falling pitch glides of [a, i] in the fundamental frequency (f_o) interval [150 Hz, 320 Hz]. The interval contains the first vocal tract resonance f_R1 and the first formant F1 of [i] as well as the fractions of the first resonance f_R1/4 and fR1/3 of [a]. The simulations reveal a locking pattern of the fo-trajectory at f_R1 of [i] in falling and rising glides. The resonance fractions of [a] produce perturbations in the pressure signal at the lips but no locking. All these observations from the model behaviour are consistent and robust within a wide range of feasible model parameter values and under exclusion of secondary model components.

研究动机与目标

  • 开发一种基于物理原理、具有时域特性的完整言语产生系统模型,通过声道声学反馈实现对声带的反馈控制。
  • 研究声道共振及其分数如何影响音高滑动期间声门源的动力学行为。
  • 通过广泛测试参数值并排除次要组件,验证模型的鲁棒性。
  • 为高分辨率 3D 声道声学与言语信号处理应用,提供一个可控且可调的声门脉冲源。
  • 利用反馈耦合的动力系统,解释在共振峰附近基频轨迹中未被解释的扰动现象,特别是模态锁定机制。

提出的方法

  • 数值求解描述声门血流、声带振荡及声道声学的耦合常微分与偏微分方程。
  • 采用磁共振成像(MRI)获取的声道几何结构定义声学域,并通过带边界条件的波动方程数学求解计算共振频率(fR1、fR2 等)。
  • 实现从声道压力到声带动力学的反馈机制,从而实现动态耦合。
  • 在 150–320 Hz 范围内模拟 [a] 和 [i] 的音高上升与下降滑音,覆盖 [i] 的 fR1 及 [a] 的共振分数。
  • 通过调节模型参数以匹配实验测得的声门脉冲波形,未引入显式神经控制或动态声道几何变化。
  • 采用多质量声带模型与流动-声学模型耦合,模拟真实的发声过程及扰动现象。

实验结果

研究问题

  • RQ1声道声学反馈是否会导致基频(fo)在第一 formant(F1)或其共振频率(fR1)处发生模态锁定?
  • RQ2声道共振分数(如 fR1/3、fR1/4)如何影响音高滑动期间的声门脉冲扰动?
  • RQ3所观察到的锁定行为是否在广泛可行的模型参数范围内保持鲁棒,并且独立于次要模型组件?
  • RQ4该模型能否再现锁定事件期间的典型发声变化,如气息音调制?
  • RQ5该模型的行为在多大程度上与自然言语中的实验观测结果以及先前的物理或计算模型一致?

主要发现

  • 在音高上升与下降滑音过程中,[i] 的 fR1 处始终观察到 fo 的模态锁定,其基频轨迹呈现特征性的时间依赖模式。
  • 在 [a] 的共振分数(如 fR1/3、fR1/4)处,模态锁定现象缺失,取而代之的是声门压力信号中的瞬态扰动,无频率锁定。
  • 锁定事件伴随可测量的发声变化:在锁定前与锁定期间,气息音程度增加,且在锁定阶段呈现稳定的气息音变化。
  • 该模型的预测在广泛参数范围内保持鲁棒,且在排除次要组件(如声门下或声门上效应)后仍保持一致。
  • 模拟的声门波形与流动动力学与反向滤波法及物理模型所得实验数据高度吻合,验证了模型的生理合理性。
  • 声道向声带的声学反馈是实现模态锁定的必要条件;若无此反馈,将不会出现此类锁定现象。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。