Skip to main content
QUICK REVIEW

[论文解读] Learning Robust Heterogeneous Signal Features from Parallel Neural Network for Audio Sentiment Analysis

Feiyang Chen, Ziqian Luo|arXiv (Cornell University)|Nov 20, 2018
Music and Audio Processing参考文献 41被引用 9
一句话总结

该论文提出AFF-ACRNN,一种并行的CNN-LSTM神经网络模型,通过带有注意力机制的双向LSTM实现特征融合,提取鲁棒的异质性音频特征——频谱、倒谱和梅尔频谱图表示。该模型在MOSI数据集上相比最先进方法实现了9.33%的性能提升,展示了在音频情感分析中更优的准确率与泛化能力。

ABSTRACT

Audio Sentiment Analysis is a popular research area which extends the conventional text-based sentiment analysis to depend on the effectiveness of acoustic features extracted from speech. However, current progress on audio sentiment analysis mainly focuses on extracting homogeneous acoustic features or doesn't fuse heterogeneous features effectively. In this paper, we propose an utterance-based deep neural network model, which has a parallel combination of Convolutional Neural Network (CNN) and Long Short-Term Memory (LSTM) based network, to obtain representative features termed Audio Sentiment Vector (ASV), that can maximally reflect sentiment information in an audio. Specifically, our model is trained by utterance-level labels and ASV can be extracted and fused creatively from two branches. In the CNN model branch, spectrum graphs produced by signals are fed as inputs while in the LSTM model branch, inputs include spectral features and cepstrum coefficient extracted from dependent utterances in audio. Besides, Bidirectional Long Short-Term Memory (BiLSTM) with attention mechanism is used for feature fusion. Extensive experiments have been conducted to show our model can recognize audio sentiment precisely and quickly, and demonstrate our ASV is better than traditional acoustic features or vectors extracted from other deep learning models. Furthermore, experimental results indicate that the proposed model outperforms the state-of-the-art approach by 9.33\% on Multimodal Opinion-level Sentiment Intensity dataset (MOSI) dataset.

研究动机与目标

  • 为解决现有音频情感分析方法依赖同质性特征或异质性声学特征融合效率低下的局限性。
  • 开发一种深度学习模型,通过利用频谱和时序信号表示,捕捉话语中的上下文相关情感线索。
  • 通过上下文感知的注意力机制融合多种音频信号类型的判别性特征,提升情感分类准确率。
  • 验证模型在多样化语言和情感语境下的鲁棒性,包括低资源语言和非英语语言。
  • 展示所提出的音频情感向量(ASV)在多语言和多模态设置下的泛化能力。

提出的方法

  • 该模型采用并行架构,CNN分支处理频谱图输入,LSTM分支处理从话语中提取的倒谱和频谱特征。
  • 使用Librosa工具包提取四种关键异质性声学特征——梅尔频谱图、MFCC、音高图谱和过零率,并作为双分支网络的输入。
  • 分别从CNN和LSTM分支生成音频情感向量(ASV):从CNN分支生成CASV,从LSTM分支生成LASV,采用全局平均池化。
  • 带有注意力机制的双向LSTM(BiLSTM)将CASV和LASV融合为最终的ASV,突出情感相关的时序模式。
  • 模型采用端到端训练方式,使用话语级别的情感标签进行训练,联合优化特征提取与分类过程。
  • 注意力机制根据特征向量与情感的相关性动态加权,增强其判别能力。

实验结果

研究问题

  • RQ1并行的CNN-LSTM架构能否有效提取并融合异质性声学特征,以提升音频情感分类性能?
  • RQ2与单分支或非注意力方法相比,基于注意力的CNN和LSTM分支融合如何提升情感表征能力?
  • RQ3所提出的模型在不同语言和方言(如普通话、粤语和四川话)中的泛化程度如何?
  • RQ4音频情感向量(ASV)是否在情感识别中优于传统声学特征或其他深度学习模型生成的向量?
  • RQ5与最先进方法相比,该模型在低资源或非英语音频数据集上的表现如何?

主要发现

  • 所提出的AFF-ACRNN模型在MOSI数据集上相比最先进方法实现了9.33%的绝对准确率提升,达到69.42%的加权准确率。
  • 带有注意力机制的BiLSTM显著增强了特征融合效果,优于无注意力或采用简单融合策略的模型。
  • 该模型展现出强大的泛化能力,在普通话测试集上达到68.84%的准确率,在验证集上达到64.08%,即使在训练数据有限的情况下亦表现良好。
  • SBCNN分支采用ResNet152、LSTM分支采用UB-BiLSTM的组合取得了最佳性能,在MOSI数据集上达到69.42%的加权准确率。
  • 该模型在MOUD数据集上保持高性能,表明其对语言差异具有鲁棒性,并降低了对语言特异性的依赖。
  • 通过大量消融实验发现,所选的四种异质性特征(梅尔频谱图、MFCC、音高图谱和过零率)在情感分类中最具代表性。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。