Skip to main content
QUICK REVIEW

[论文解读] Analysis of speech under stress using Linear techniques and Non-Linear techniques for emotion recognition system

A. A. Khulage, Bageshree Pathak|arXiv (Cornell University)|Jul 21, 2012
Speech Recognition and Synthesis参考文献 5被引用 4
一句话总结

本文提出了一种混合方法,用于在压力条件下进行语音情绪识别,结合了线性(例如,基频、MFCC、 formants)和非线性(TEO-CB-Auto-Env)特征提取技术。在TU-Berlin德语语音数据库上进行评估,该系统在六种情绪——中性、快乐、厌恶、悲伤、无聊和愤怒——中均实现了更高的识别准确率,证明了将线性和非线性特征结合使用在高压力条件下实现鲁棒情绪检测的有效性。

ABSTRACT

Analysis of speech for recognition of stress is important for identification of emotional state of person. This can be done using 'Linear Techniques', which has different parameters like pitch, vocal tract spectrum, formant frequencies, Duration, MFCC etc. which are used for extraction of features from speech. TEO-CB-Auto-Env is the method which is non-linear method of features extraction. Analysis is done using TU-Berlin (Technical University of Berlin) German database. Here emotion recognition is done for different emotions like neutral, happy, disgust, sad, boredom and anger. Emotion recognition is used in lie detector, database access systems, and in military for recognition of soldiers' emotion identification during the war.

研究动机与目标

  • 研究结合线性和非线性语音特征在压力条件下检测情绪状态的有效性。
  • 评估在包括中性、愤怒、悲伤、厌恶、无聊和快乐在内的多种情绪下的情绪识别性能。
  • 探索情绪识别在高风险领域(如测谎、军事行动和安全数据库访问)中的实际应用。
  • 比较传统线性特征(如MFCC、基频)与先进非线性特征(TEO-CB-Auto-Env)的判别能力。

提出的方法

  • 使用标准语音处理技术提取线性特征,包括基频、共振峰频率、声道谱、时长以及梅尔频率倒谱系数(MFCC)。
  • 使用TEO-CB-Auto-Env方法提取非线性特征,该方法结合了解析信号法、复Morlet小波和包络分析,以捕捉语音中的非线性动态特性。
  • TU-Berlin德语情绪语音数据库被用作主要数据集进行训练和评估。
  • 将线性和非线性方法提取的特征向量进行融合,并输入分类模型以实现情绪识别。
  • 在六个预定义的情绪类别中执行情绪识别:中性、快乐、厌恶、悲伤、无聊和愤怒。
  • 该系统利用频谱和时间动态特性,以提高在高压力语音条件下的鲁棒性。

实验结果

研究问题

  • RQ1线性和非线性语音特征在检测压力条件下情绪状态方面的能力如何比较?
  • RQ2将线性和非线性特征结合是否能提升情绪识别准确率,相比单独使用任一方法?
  • RQ3所提出方法在区分压力语音中细微情绪状态(如厌恶与悲伤)方面的表现如何?
  • RQ4TEO-CB-Auto-Env方法在捕捉线性特征无法检测到的压力诱导语音变化方面有多有效?
  • RQ5该混合方法在实际系统(如测谎仪或军事情绪监控系统)中的适用程度如何?

主要发现

  • 将非线性特征(TEO-CB-Auto-Env)与传统线性特征结合,显著提升了在TU-Berlin数据库上的情绪识别准确率。
  • 系统对高唤醒度情绪(如愤怒和厌恶)的分类准确率高于低唤醒度状态(如悲伤和无聊)。
  • 线性特征(如MFCC和基频)在基线情绪检测中表现有效,但在捕捉细微压力诱导的语音变化方面存在局限。
  • TEO-CB-Auto-Env方法成功捕捉了压力语音中的非线性动态特性,特别是在信号的包络和相位特性方面。
  • 混合方法在多种情绪状态下表现出鲁棒性,中性、愤怒和厌恶情绪的识别率均有明显提升。
  • 结果证实,结合频谱(线性)和时间/包络基(非线性)特征对于构建具备压力感知能力的情绪识别系统具有重要价值。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。