Skip to main content
QUICK REVIEW

[論文レビュー] How far are vowel formants from computed vocal tract resonances?

Daniel Aalto, Antti Huhtala|arXiv (Cornell University)|Aug 29, 2012
Phonetics and Phonology Research参考文献 30被引用数 10
ひとこと要約

本研究では、MRIを用いて得られた3次元解剖的形状を基に有限要素法(FEM)を用いて数値的に計算された声道共振峰と、同時に録音された発話から測定された母音フォルマントを比較している。口唇部に簡素化されたディリクレ境界条件を適用しても、[i] や [u] のような口を閉じた母音では、半音未満の精度(≤0.7 semitones)を達成しているが、[a] や [ae:] のような口を大きく開けた母音では、誤差が約3 semitonesにまで拡大しており、主に外部音響空間の不適切なモデル化と開放された軟口蓋洞の欠如に起因している。外部音響空間および軟口蓋洞の境界条件を改善すれば、誤差を1 semitone未満にまで低減できる可能性がある。

ABSTRACT

We compare numerically computed resonances of the human vocal tract with formants that have been extracted from speech during vowel pronunciation. The geometry of the vocal tract has been obtained by MRI from a male subject, and the corresponding speech has been recorded simultaneously. The resonances are computed by solving the Helmholtz partial differential equation with the Finite Element Method (FEM). Despite a rudimentary exterior space acoustics model, i.e., the Dirichlet boundary condition at the mouth opening, the computed resonance structure differs from the measured formant structure by $\approx$ 0.7 semitones for [i] and [u] having small mouth opening area, and by $\approx$ 3 semitones for vowels [a] and [ae] that have a larger mouth opening. The contribution of the possibly open velar port has not been taken into considaration at all which adds the discrepancy for [a] in the present data set. We conclude that by improving the exterior space model and properly treating the velar port opening, it is possible to computationally attain four lowest vowel formants with an error less than a semitone. The corresponding wave equation model on MRI-produced vocal tract geometries is expected to have a comparable accuracy.

研究の動機と目的

  • MRIを用いて得られた3次元解剖的形状を基に、数値的に計算された声道共振峰と測定された母音フォルマントの精度を評価すること。
  • 持続母音発話における計算された共振峰と測定されたフォルマントの差異の原因を特定・定量すること。
  • 特に口唇部におけるディリクレ境界条件と、開放された軟口蓋洞のモデル化の欠如といった簡素化された境界条件が、共振峰予測精度に与える影響を評価すること。
  • 外部音響空間および軟口蓋洞の境界条件を改善することで、計算された共振峰の誤差を1 semitone未満にまで低減できるかどうかを検討すること。

提案手法

  • 男性フィンランド人の発話中におけるMRIスキャンから声道幾何形状を再構築した。
  • 3次元形状から音響共振峰を計算するために、ヘルムホルツ方程式を有限要素法(FEM)で解いた。
  • 波動方程式モデル(1)を用い、口唇部(Γ₁)にディリクレ境界条件、声道壁(Γ₂)にノイマン条件、制御面(Γ₃)に声門入力モデルを設定した。
  • フォルマントは、同時に録音された発話を用いて線形予測符号化(LPC)により抽出した。[i] のF₃およびF₄には高次のLPCを用いた。
  • 計算された共振峰(Rᵢ)と測定されたフォルマント(Fᵢ)の差異を、式 D = 12·ln(Rᵢ/Fᵢ)/ln(2) を用いて半音単位で定量化した。
  • 共振峰比(Rᵢ/R₁)とフォルマント比(Fᵢ/F₁)の比較、および軟口蓋洞の開放が共振峰誤差に与える影響の評価により、モデルの妥当性を検証した。

実験結果

リサーチクエスチョン

  • RQ1MRIを用いて得られた3次元解剖的形状から計算されたFEMシミュレート共振峰は、測定された母音フォルマントとどの程度一致するか?
  • RQ2口を開けた大きさが異なる母音において、計算された共振峰と測定されたフォルマントの主な差異の原因は何か?
  • RQ3具体的には、口唇部にディリクレ境界条件を適用しているが、外部音響空間の現実的なモデル化が欠如していることが、共振峰予測精度にどの程度影響を及えるか?
  • RQ4開放された軟口蓋洞が、[a] のような母音において、計算された共振峰と測定されたフォルマントの不一致にどの程度寄与しているか?
  • RQ5口唇部および軟口蓋洞の境界条件を改善することで、計算された共振峰の誤差を測定されたフォルマントに対して1 semitone未満にまで低減できるか?

主な発見

  • 口を閉じた母音 [i] および [u] では、計算された共振峰と測定されたフォルマントとの差異が約0.7 semitonesにとどまり、簡素化された境界条件にもかかわらず良好な一致を示している。
  • 口を大きく開けた母音 [a] および [ae:] では、差異が約3 semitonesにまで拡大しており、主に口唇部における現実的でないディリクレ境界条件が原因である。
  • [a] 母音のMRIスキャンでは、軟口蓋洞が開放されており、計算モデルが閉じた完全に反射する境界を仮定しているのに対し、実際の声道は鼻腔の開放を有していたため、共振峰誤差に顕著な寄与が見られた。
  • すべての母音において、共振峰比(Rᵢ/R₁)とフォルマント比(Fᵢ/F₁)が良好に相関しており、モデルが共振峰の相対的構造を適切に再現していることが示された。
  • [u] では、口の開きが小さく軟口蓋洞が閉じているため、誤差が最小限に抑えられ、自然なフォルマント変動(約0.5 semitones)と同等の精度を示した。
  • 本研究は、外部音響空間および軟口蓋洞の境界条件を改善すれば、測定されたフォルマントに対して1 semitone未満の誤差で共振峰を予測可能であると結論づけた。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。