Skip to main content
QUICK REVIEW

[论文解读] Speaking Style Authentication Using Suprasegmental Hidden Markov Models

Ismail Shahin|arXiv (Cornell University)|Jun 29, 2017
Speech and Audio Processing参考文献 21被引用 9
一句话总结

本文提出了一种基于超音段隐马尔可夫模型(SPHMMs)的说话人与文本相关语音风格认证系统,通过基频、能量和节奏等语音特征验证身份。该方法在中性风格下平均认证准确率达到99%,在慢速说话时达到85%,在愤怒、恐惧及喊叫等多样化的说话风格下均表现出高可靠性。

ABSTRACT

The importance of speaking style authentication from human speech is gaining an increasing attention and concern from the engineering community. The importance comes from the demand to enhance both the naturalness and efficiency of spoken language human-machine interface. Our work in this research focuses on proposing, implementing, and testing speaker-dependent and text-dependent speaking style authentication (verification) systems that accept or reject the identity claim of a speaking style based on suprasegmental hidden Markov models (SPHMMs). Based on using SPHMMs, our results show that the average speaking style authentication performance is: 99%, 37%, 85%, 60%, 61%, 59%, 41%, 61%, and 57% belonging respectively to the speaking styles: neutral, shouted, slow, loud, soft, fast, angry, happy, and fearful.

研究动机与目标

  • 开发一种鲁棒的说话人与文本相关语音风格认证系统,以改善人机交互。
  • 解决基于语音风格而非仅说话人身份或语音内容来验证身份的挑战。
  • 评估超音段特征在区分不同语音风格方面的性能。
  • 建立基于语音韵律特征训练的HMM的语音风格验证基线。
  • 分析情感与表达性语音变化对认证准确率的影响。

提出的方法

  • 系统利用从语音信号中提取的超音段特征(如基频、能量和过零率)建模语音风格。
  • 在韵律特征上训练超音段隐马尔可夫模型(SPHMMs),以表示语音风格的时间动态特性。
  • 采用说话人相关与文本相关的训练方式,即为每位说话人的特定语句在不同风格下建立语音模型。
  • 从语音帧中提取特征向量,并聚类以在HMM状态空间中表示不同的语音风格。
  • 通过计算测试语音在每个说话人-风格模型下的似然度,并选择得分最高的匹配结果完成认证。
  • 系统使用等错误率(EER)和九种不同语音风格下的准确率评估性能。

实验结果

研究问题

  • RQ1超音段特征能否有效区分不同语音风格以实现说话人认证?
  • RQ2SPHMMs在中性、愤怒及喊叫等多样化语音风格下的性能表现如何?
  • RQ3文本依赖性和说话人依赖性对认证准确率有何影响?
  • RQ4情感与表达性语音变化在多大程度上会降低或提升系统性能?
  • RQ5与传统说话人验证系统相比,所提出的基于SPHMM的方法在风格特定准确率方面表现如何?

主要发现

  • 系统在中性语音风格下的认证准确率达到99%,为所有测试风格中的最高值。
  • 在喊叫语音风格下准确率显著下降至37%,表明在极端音量强度下建模存在挑战。
  • 慢速语音风格的准确率达到85%,表明在控制性、刻意性语音中表现优异。
  • 大声、轻声、快速、愤怒、快乐及恐惧语音风格的准确率分别为60%、61%、59%、41%、61%和57%,表明具有中等至较高可靠性。
  • 结果表明SPHMMs在建模不同语音风格的韵律变化方面具有有效性,尤其在控制性或表达性但非极端条件下表现更优。
  • 研究证实,超音段特征对基于风格的认证具有高度判别性,性能差异显著,取决于语音的情感或物理强度。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。