Skip to main content
QUICK REVIEW

[论文解读] An Ensemble Framework of Voice-Based Emotion Recognition System for Films and TV Programs

Fei Tao, Gang Liu|arXiv (Cornell University)|Mar 3, 2018
Music and Audio Processing参考文献 21被引用 3
一句话总结

该论文提出了一种用于真实影视音频中基于语音的情感识别的集成深度学习框架,结合手工提取特征、iVector、词汇信息和基于注意力的RNN,并采用多任务学习进行性别和说话人分类。该系统在最佳基线基础上实现了29.5%的相对提升(绝对提升7.8个百分点),在噪声大、非语音内容丰富且长度可变的音频场景中表现出良好的鲁棒性。

ABSTRACT

Employing voice-based emotion recognition function in artificial intelligence (AI) product will improve the user experience. Most of researches that have been done only focus on the speech collected under controlled conditions. The scenarios evaluated in these research were well controlled. The conventional approach may fail when background noise or nonspeech filler exist. In this paper, we propose an ensemble framework combining several aspects of features from audio. The framework incorporates gender and speaker information relying on multi-task learning. Therefore it is able to dig and capture emotional information as much as possible. This framework is evaluated on multimodal emotion challenge (MEC) 2017 corpus which is close to real world. The proposed framework outperformed the best baseline system by 29.5% (relative improvement).

研究动机与目标

  • 开发一种在真实音频条件下表现良好的鲁棒性语音情感识别系统,例如在存在背景噪声、非语音填充物以及长度可变的音频中表现良好。
  • 通过在MEC 2017语料库上进行评估,解决先前研究依赖于受控录音室数据的局限性,该语料库由包含真实音频挑战的电影和电视片段组成。
  • 通过整合多种特征类型——手工提取的语调特征(IS10)、iVector表示、来自自动语音识别(ASR)的词汇内容,以及基于注意力机制的深度神经网络表示——来提升情感识别性能。
  • 利用多任务学习,将性别和说话人分类作为辅助任务以增强主要的情感识别任务,所用标签在实际中易于获取。
  • 设计一种集成框架,融合多个子系统以发挥其互补优势,从而提高整体识别准确率和鲁棒性。

提出的方法

  • 该框架采用四个子系统的集成:基于IS10特征的多任务DNN、基于iVector特征的多任务DNN、基于ASR转录本的词汇SVM,以及基于注意力机制的加权池化RNN。
  • 在DNN和RNN子系统中应用多任务学习,其中情感分类为主要任务,性别和说话人分类为辅助任务,任务权重分别为0.6和0.3。
  • RNN中的注意力机制通过学习到的权重向量计算上下文感知的池化:$ A_T = \frac{\exp(W \cdot h_T)}{\sum_{t=1}^{n} \exp(W \cdot h_T)} $,使模型能够聚焦于关键的时间段。
  • 对特征进行归一化处理:IS10特征使用训练集统计量进行z标准化,序列特征在每个语音段内进行归一化。
  • 集成融合通过在验证数据上训练的线性组合权重,将子系统预测结果进行组合,以优化宏F1分数。
  • 网络训练采用随机梯度下降(SGD)训练DNN,使用Adam优化器训练RNN,批量大小为32,10%的训练数据保留用于验证。

实验结果

研究问题

  • RQ1结合多样化音频特征(语调、iVector、词汇、深度表示)的集成框架是否能在真实世界情感识别中优于单模型基线?
  • RQ2将性别和说话人分类作为辅助任务的多任务学习,在低资源、噪声大且非语音内容丰富的音频中,对提升情感识别性能有多有效?
  • RQ3非语音发声(如叹息、笑声)在情感识别中的贡献程度如何?该框架能否有效建模这些成分?
  • RQ4与标准RNN或DNN相比,基于注意力机制的RNN是否能在可变长度语音段上实现性能提升?
  • RQ5多个具有互补优势的子系统通过融合,如何提升在MEC 2017语料库上整体情感识别的准确率和鲁棒性?

主要发现

  • 所提出的集成框架在宏F1分数(MAF)上达到34.2%,相比最佳基线系统(单任务DNN)绝对提升了7.8个百分点,相对提升达29.5%。
  • 使用IS10特征的多任务DNN子系统取得32.4%的MAF,相比单任务DNN基线(26.4%)提升了6个百分点,证明了辅助任务的有效性。
  • 基于注意力机制的RNN子系统取得23.2%的MAF,低于基线DNN,可能由于有效训练数据不足(仅4.5小时)导致RNN难以充分训练。
  • 词汇SVM子系统表现较差(MAF 17.7%),表明ASR生成的文本特征在此情境下不可靠,可能因转录错误所致。
  • 使用iVector特征的多任务DNN子系统取得27.4%的MAF,表明iVector表示在情感识别中也有效,但效果不如IS10特征。
  • 集成融合策略成功结合了各子系统的优势,证实了多样化特征类型与建模方法的结合可显著提升真实音频上的整体性能。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。