Skip to main content
QUICK REVIEW

[论文解读] Acoustic Correlates of the Voice Qualifiers: A Survey

Shahan Ali Memon|arXiv (Cornell University)|Oct 29, 2020
Voice and Speech Disorders参考文献 46被引用 8
一句话总结

本文综述了语音特征(如气息声、沙哑声和耳语声等非语言性嗓音特征)的声学相关特征,将感知特征映射到可测量的声学参数和openSMILE特征。该研究建立了一个全面的参考框架,通过经过验证的声学线索和特征集,将嗓音质量与情绪、个性及健康状态等副语言推断关联起来。

ABSTRACT

Our voices are as distinctive as our faces and fingerprints. There is a spectrum of non-disjoint traits that make our voices unique and identifiable, such as the fundamental frequency, the intensity, and most interestingly the quality of the speech. Voice quality refers to the characteristic features of an individual's voice. Previous research has from time-to-time proven the ubiquity of voice quality in making different paralinguistic inferences. These inferences range from identifying personality traits, to health conditions and beyond. In this manuscript, we first map the paralinguistic voice qualifiers to their acoustic correlates in the light of the previous research and literature. We also determine the openSMILE correlates one could possibly use to measure those correlates. In the second part, we give a set of example paralinguistic inferences that can be made using different acoustic and perceptual voice quality features.

研究动机与目标

  • 基于现有文献,系统地将感知性嗓音特征映射到其声学相关特征。
  • 识别可作为测量嗓音质量参数可靠代理的openSMILE特征。
  • 展示如何利用嗓音质量的声学特征推断说话者特征和情绪状态。
  • 为语音技术、情感计算和嗓音病理学领域的研究人员提供参考框架。
  • 在感知嗓音质量与可测量、可计算的声学特征之间建立桥梁,以支持机器学习应用。

提出的方法

  • 通过文献综述,识别16种嗓音特征(包括气息声、沙哑声和声门化声等)的既定声学相关特征。
  • 将每种嗓音质量与其生理基础和感知定义对应,然后识别相关声学线索,如F0、HNR、jitter和频谱倾斜度。
  • 将识别出的声学特征映射到openSMILE特征集,以便在嗓音分析流程中实际应用。
  • 使用结构化表格(表1)交叉对照嗓音特征、其定义、生理成因、声学相关特征及对应的openSMILE特征。
  • 通过与先前关于嗓音质量感知和声学建模的研究结果对齐,验证该映射的可靠性。
  • 通过将声学特征与自信、亲和力和吸引力等特质关联,将该框架扩展至副语言推断(表2)。

实验结果

研究问题

  • RQ1哪些声学特征能可靠地与气息声、沙哑声和耳语声等感知性嗓音特征相关联?
  • RQ2openSMILE特征如何用于计算测量和分类嗓音质量特征?
  • RQ3哪些声学线索能够实现从嗓音质量中推断说话者特征(如自信、亲和力或吸引力)?
  • RQ4沙哑声或震颤声等嗓音特征如何与病理或情绪状态相关联?
  • RQ5能否为不同说话者状态和发声行为下的嗓音质量建立统一的声学相关特征框架?

主要发现

  • 气息声可通过陡峭的频谱斜率(超过12 dB/八度)、低HNR、升高的H1-H2以及在5–8 kHz频段相对于2–5 kHz频段的能量增加来可靠指示。
  • 沙哑声的特征包括低F0、不规则的基频、较高的亚谐波与谐波比(SHR)以及谐波振幅降低,特别是H1-H2和H1-A3测量值。
  • 声门化声最适宜通过向下倾斜的频谱斜率、F1振幅降低和更高的频谱倾斜度来捕捉,这些均可通过openSMILE的mfcc和频谱斜率特征测量。
  • 自信和热情与较高的F0、更高的频谱能量以及更高的过零率相关,这些均可通过openSMILE的F0和pcm_RMSenergy特征检测。
  • 男性说话者的声音成熟度和吸引力与较低的中位F0、更高的F0范围以及更大的F3带宽变异度相关,可通过F0semitoneFrom27.5Hz和带宽标准差特征测量。
  • 对于女性说话者,吸引力和自信与更高的F0范围、更高的F1以及更低的平均频谱斜率(0–500 Hz)相关,openSMILE特征如slopeV0500_sma3nz_amean和F1frequency_sma3nz_amean提供了关键线索。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。