Skip to main content
QUICK REVIEW

[논문 리뷰] Modal locking between vocal fold and vocal tract oscillations: Simulations in time domain

Atte Aalto, Tiina Murtola|arXiv (Cornell University)|2015. 06. 03.
Speech Recognition and Synthesis참고 문헌 71인용 수 4
한 줄 요약

이 연구는 시간 도메인에서 인간의 음성 기관을 모델링한 계산적 모델을 제시하며, 피드백을 통한 간질리움 운동과 음역관 음향 간의 결합을 통해 150–320 Hz 범위에서 [a]와 [i]의 모음 미끄러짐을 시뮬레이션한다. 모델은 [i]의 첫 번째 음역관 공진주파수(fR1)에서 기본주파수(fo)의 강력한 모드 잠금 현상을 드러내며, [a]의 공진 분수는 잠금 없이 진동을 방해함으로써, 음성 발성에서 피드백 기반의 동적 결합을 입증한다.

ABSTRACT

During voiced speech, the human vocal folds interact with the vocal tract acoustics. The resulting glottal source-resonator coupling has been observed using mathematical and physical models as well as in in vivo phonation. We propose a computational time-domain model of the full speech apparatus that, in particular, contains a feedback mechanism from the vocal tract acoustics to the vocal fold oscillations. It is based on numerical solution of ordinary and partial differential equations defined on vocal tract geometries that have been obtained by Magnetic Resonance Imaging. The model is used to simulate rising and falling pitch glides of [a, i] in the fundamental frequency (f_o) interval [150 Hz, 320 Hz]. The interval contains the first vocal tract resonance f_R1 and the first formant F1 of [i] as well as the fractions of the first resonance f_R1/4 and fR1/3 of [a]. The simulations reveal a locking pattern of the fo-trajectory at f_R1 of [i] in falling and rising glides. The resonance fractions of [a] produce perturbations in the pressure signal at the lips but no locking. All these observations from the model behaviour are consistent and robust within a wide range of feasible model parameter values and under exclusion of secondary model components.

연구 동기 및 목표

  • 음역관 음향에서 간질리움에 피드백이 가해지는 물리적으로 타당한 시간 도메인 모델을 개발하여 전체 음성 생성 시스템을 구현한다.
  • 음향 공진주파수와 그 분수들이 음고 미끄러짐 중 간질리움 소스 동역학에 미치는 영향을 조사한다.
  • 광범위한 매개변수 값 테스트와 보조 성분 제거를 통해 모델의 강건성을 검증한다.
  • 고해상도 3D 음역관 음향 및 음성 신호 처리 응용 분야에 적합한 제어 가능하고 조절 가능한 간질리움 펄스 소스를 제공한다.
  • 피드백-결합 동역계를 통해 기존에 설명되지 않았던 형성 주파수 근처의 fo 궤적 진동, 특히 모드 잠금 현상을 설명한다.

제안 방법

  • 간질리움 유량, 간질리움 진동, 음역관 음향을 모델링하는 연립 상미분 및 편미분 방정식의 수치적 해법을 사용한다.
  • MRI 기반 음역관 기하학적 구조를 활용하여 음향 영역을 정의하고, 경계 조건을 갖는 파동 방정식의 수학적 해로서 공진주파수(fR1, fR2 등)를 계산한다.
  • 음역관 압력에서 간질리움 운동에 이르는 피드백을 구현하여 동적 결합을 가능하게 한다.
  • 150–320 Hz 범위에서 [a]와 [i]에 대해 상승 및 하강 음고 미끄러짐을 시뮬레이션하며, [i]의 fR1와 [a]의 공진 분수를 포함한다.
  • 실험적 간질리움 펄스 파형과 일치시키기 위해 모델 매개변수를 조정하였으며, 명시적 신경 제어나 변화하는 음역관 기하학적 구조를 고려하지 않았다.
  • 유량-음향 모델과 결합된 다질량 간질리움 모델을 사용하여 현실적인 발성과 진동을 시뮬레이션한다.

실험 결과

연구 질문

  • RQ1음역관에서 간질리움으로의 음향 피드백이 첫 번째 형성주파수(F1) 또는 그 공진주파수(fR1)에서 기본주파수(fo)의 모드 잠금을 유도하는가?
  • RQ2음역관의 공진 분수(예: fR1/3, fR1/4)가 음고 미끄러짐 중 간질리움 펄스 진동에 어떤 영향을 미치는가?
  • RQ3관측된 잠금 행동은 광범위한 타당한 모델 매개변수 범위에서 강건하며, 보조 성분의 영향을 받지 않는가?
  • RQ4잠금 사건 동안 특징적인 발성 변화, 예를 들어 숨소리의 조절이 모델에서 재현될 수 있는가?
  • RQ5모델의 행동이 자연 음성에서의 실험적 관찰 및 이전의 물리적 또는 계산 모델과 얼마나 일치하는가?

주요 결과

  • [i]의 fR1에서 fo의 모드 잠금 현상은 상승 및 하강 음고 미끄러짐 모두에서 일관되게 관측되며, fo 궤적에서 시간에 따라 변화하는 패턴을 보인다.
  • [a]의 공진 분수(예: fR1/3, fR1/4)에서는 잠금 현상이 관측되지 않으며, 이는 주파수 잠금 없이 간질리움 압력 신호에서 일시적인 진동을 유도한다.
  • 잠금 사건은 발성에 측정 가능한 변화를 동반한다: 잠금 이전과 동안 숨소리가 증가하며, 잠금 단계 동안에는 숨소리가 안정적으로 변화한다.
  • 모델의 예측은 광범위한 매개변수 값에서 강건하며, 보조 성분(예: 기도하부 또는 기도상부 효과)을 제거한 경우에도 일관성을 유지한다.
  • 모의 간질리움 파형과 유량 동역학은 역필터링 및 물리 모델에서의 실험 데이터와 밀도 있게 일치하여, 모델의 생리학적 타당성을 검증한다.
  • 음역관에서 간질리움으로의 음향 피드백이 모드 잠금을 가능하게 하며, 이 피드백이 없을 경우 이러한 잠금 현상은 발생하지 않는다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.