Skip to main content
QUICK REVIEW

[论文解读] Temporal Modeling Matters: A Novel Temporal Emotional Modeling Approach for Speech Emotion Recognition

Jiaxin Ye, Xin-Cheng Wen|arXiv (Cornell University)|Nov 14, 2022
Emotion and Mood Recognition参考文献 24被引用 5
一句话总结

该论文提出TIM-Net,一种新颖的双向多尺度时序建模网络,用于语音情感识别(SER),通过空洞因果卷积、双向时序感知和动态融合,捕捉长程依赖关系并适应不同情感时间尺度。TIM-Net在六个基准数据集上达到最先进性能,相较于第二好的方法,平均UAR和WAR分别提升2.34%和2.61%。

ABSTRACT

Speech emotion recognition (SER) plays a vital role in improving the interactions between humans and machines by inferring human emotion and affective states from speech signals. Whereas recent works primarily focus on mining spatiotemporal information from hand-crafted features, we explore how to model the temporal patterns of speech emotions from dynamic temporal scales. Towards that goal, we introduce a novel temporal emotional modeling approach for SER, termed Temporal-aware bI-direction Multi-scale Network (TIM-Net), which learns multi-scale contextual affective representations from various time scales. Specifically, TIM-Net first employs temporal-aware blocks to learn temporal affective representation, then integrates complementary information from the past and the future to enrich contextual representations, and finally, fuses multiple time scale features for better adaptation to the emotional variation. Extensive experimental results on six benchmark SER datasets demonstrate the superior performance of TIM-Net, gaining 2.34% and 2.61% improvements of the average UAR and WAR over the second-best on each corpus. The source code is available at https://github.com/Jiaxin-Ye/TIM-Net_SER.

研究动机与目标

  • 为解决现有SER模型在捕捉长程时序依赖关系以及适应可变情感时间尺度方面的局限性。
  • 通过学习动态多尺度感受野而非固定感受野,提升模型泛化能力。
  • 通过新颖的双向架构整合互补的过去与未来信息,增强上下文表征学习。
  • 开发一种在存在领域偏移的多样化语音语料库中能有效泛化的模型方法。
  • 提供统一框架,捕捉多时间尺度下的内部与跨依赖关系,以提升情感表征能力。

提出的方法

  • TIM-Net采用基于空洞因果卷积(DC Conv)的时序感知模块,扩展感受野,同时在不违反因果性的前提下建模长程时序依赖。
  • 双向模块独立处理前向与后向序列,随后融合来自过去与未来的互补上下文信息,以增强表征。
  • 动态融合模块自适应地结合来自多时间尺度的特征,根据输入动态调整融合权重,以提升泛化能力。
  • 模型使用梅尔频率倒谱系数(MFCCs)作为输入,采用50ms帧长与12.5ms帧移,随后经梅尔滤波器组与DCT变换提取39维系数。
  • 通过空洞卷积以递增的膨胀率提取多尺度特征,以捕捉不同时间尺度下情感模式。
  • 最终表征通过拼接与非线性变换获得,随后通过分类头实现情感预测。

实验结果

研究问题

  • RQ1多尺度双向时序建模方法是否能提升语音情感识别中的表征学习?
  • RQ2多尺度特征的动态融合是否能增强模型在多样化语音语料库中的泛化能力?
  • RQ3所提出的TIM-Net架构在基准SER数据集上的性能与鲁棒性方面,相较于现有方法有何差异?
  • RQ4模型捕捉长程依赖关系的能力在多大程度上提升了情感识别准确率?
  • RQ5模型在未见领域或跨语料设置下,无需微调是否能有效泛化?

主要发现

  • 在六个基准SER数据集上,TIM-Net相较于第二好的方法,平均UAR提升2.34个百分点,平均WAR提升2.61个百分点。
  • 消融实验表明,若移除任一组件——尤其是反向时序感知模块或多尺度融合模块——性能均出现显著下降,验证了其必要性。
  • 动态融合模块优于平均融合,表明对多尺度特征进行自适应加权可有效提升模型泛化能力。
  • t-SNE可视化显示,与GM-TCN相比,TIM-Net学习到的表征更具类别判别性,聚类边界更清晰。
  • 在跨语料泛化设置中,TIM-Net显著优于TCN与CAAM(一种近期的领域自适应方法),表明其对领域偏移具有强鲁棒性。
  • 在10折交叉验证下,模型平均UAR达到88.76%,平均WAR达到88.97%,在所有数据集上均表现出一致优越性。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。