Skip to main content
QUICK REVIEW

[论文解读] How far are vowel formants from computed vocal tract resonances?

Daniel Aalto, Antti Huhtala|arXiv (Cornell University)|Aug 29, 2012
Phonetics and Phonology Research参考文献 30被引用 10
一句话总结

本研究将基于MRI获取的三维解剖结构使用有限元法(FEM)数值计算的声道共振与同步语音记录测得的元音共振峰进行对比。尽管在口部采用简化的狄利克雷边界条件,模型在闭口元音如[i]和[u]上仍实现了亚半音精度(≤0.7个半音),但在开口元音如[a]和[ae:]上则表现出较大偏差(≈3个半音),主要由于对外部声学空间和开放软腭通道的建模不足。通过改进这些边界条件,误差可降低至一个半音以内。

ABSTRACT

We compare numerically computed resonances of the human vocal tract with formants that have been extracted from speech during vowel pronunciation. The geometry of the vocal tract has been obtained by MRI from a male subject, and the corresponding speech has been recorded simultaneously. The resonances are computed by solving the Helmholtz partial differential equation with the Finite Element Method (FEM). Despite a rudimentary exterior space acoustics model, i.e., the Dirichlet boundary condition at the mouth opening, the computed resonance structure differs from the measured formant structure by $\approx$ 0.7 semitones for [i] and [u] having small mouth opening area, and by $\approx$ 3 semitones for vowels [a] and [ae] that have a larger mouth opening. The contribution of the possibly open velar port has not been taken into considaration at all which adds the discrepancy for [a] in the present data set. We conclude that by improving the exterior space model and properly treating the velar port opening, it is possible to computationally attain four lowest vowel formants with an error less than a semitone. The corresponding wave equation model on MRI-produced vocal tract geometries is expected to have a comparable accuracy.

研究动机与目标

  • 评估基于MRI获取的三维解剖结构计算的声道共振与实测元音共振峰之间的准确性。
  • 识别并量化在持续元音发音中,计算共振与实测共振峰之间差异的来源。
  • 评估简化边界条件(特别是口部的狄利克雷条件及未建模的开放软腭通道)对共振预测精度的影响。
  • 确定通过改进外部声场和软腭通道建模,是否可使计算共振误差降低至一个半音以内。

提出的方法

  • 从一名芬兰男性说话者在元音发音期间的MRI扫描中重建声道几何结构。
  • 使用有限元法(FEM)求解亥姆霍兹方程,从三维几何结构中计算声学共振。
  • 采用波方程模型(1),口部开口处设为狄利克雷边界条件(Γ₁),声道壁面设为诺伊曼条件(Γ₂),声门输入模型设于控制面(Γ₃)。
  • 通过线性预测编码(LPC)从同步记录的语音中提取共振峰,对[i]的F₃和F₄使用更高阶LPC。
  • 使用公式 D = 12·ln(Rᵢ/Fᵢ)/ln(2) 以半音为单位量化计算共振(Rᵢ)与实测共振峰(Fᵢ)之间的差异。
  • 通过比较共振比(Rᵢ/R₁)与共振峰比(Fᵢ/F₁),以及评估开放软腭通道对共振误差的影响,对模型进行验证。

实验结果

研究问题

  • RQ1当基于MRI获取的三维解剖结构计算时,FEM模拟的声道共振与实测元音共振峰的匹配度如何?
  • RQ2在不同口部开合程度的元音中,计算共振与实测共振峰之间差异的主要来源是什么?
  • RQ3缺乏真实外部声学模型——特别是口部采用狄利克雷边界条件——在多大程度上影响了共振预测精度?
  • RQ4开放软腭通道如何影响计算共振与实测共振峰之间的不匹配,特别是在[a]等元音中?
  • RQ5通过改进口部和软腭通道的边界条件,能否使共振计算精度提升至实测共振峰的1个半音以内?

主要发现

  • 对于闭口元音[i]和[u],计算共振与实测共振峰的差异约为0.7个半音,表明即使在简化边界条件下,两者仍具有高度一致性。
  • 对于开口元音[a]和[ae:],差异增加至约3个半音,主要由于口部开口处采用不现实的狄利克雷边界条件。
  • 在[a]元音的MRI扫描中,开放软腭通道显著导致了共振误差,因为计算模型假设为封闭且完全反射的边界,而实际声道存在开放鼻腔通道。
  • 所有元音的共振比(Rᵢ/R₁)与共振峰比(Fᵢ/F₁)均表现出良好相关性,表明模型较好地保留了共振的相对结构。
  • 该模型在[u]上表现最佳,因其口部开口小且软腭通道关闭,误差极小,与自然共振峰变异性(≈0.5个半音)相当。
  • 研究结论认为,通过改进外部声学空间和软腭通道的建模,完全有可能实现共振预测值与实测共振峰之间的误差小于一个半音。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。