Skip to main content
QUICK REVIEW

[论文解读] Large Raw Emotional Dataset with Aggregation Mechanism

В. В. Кондратенко, Artem Sokolov|arXiv (Cornell University)|Dec 23, 2022
Speech Recognition and Synthesis被引用 4
一句话总结

本文介绍了 Dusha,一个大规模、开源的多模态俄语语音情感识别数据集,包含约 350 小时的音频和来自表演(众包)及真实生活(播客)来源的转录文本。该研究提出了一种基于 Dawid-Skene 的聚合机制,置信度阈值为 0.9,以生成可靠的语音情感标签,支持预训练(表演类)和微调(真实场景)应用,基线模型在表演类测试集上达到 0.83 的未加权准确率(UA)和 0.77 的 F1 分数。

ABSTRACT

We present a new data set for speech emotion recognition (SER) tasks called Dusha. The corpus contains approximately 350 hours of data, more than 300 000 audio recordings with Russian speech and their transcripts. Therefore it is the biggest open bi-modal data collection for SER task nowadays. It is annotated using a crowd-sourcing platform and includes two subsets: acted and real-life. Acted subset has a more balanced class distribution than the unbalanced real-life part consisting of audio podcasts. So the first one is suitable for model pre-training, and the second is elaborated for fine-tuning purposes, model approbation, and validation. This paper describes pre-processing routine, annotation, and experiment with a baseline model to demonstrate some actual metrics which could be obtained with the Dusha data set.

研究动机与目标

  • 通过创建一个新的开放基准,解决俄语中大规模、多样化且真实感强的语音情感识别数据集稀缺的问题。
  • 通过多标注者众包方法结合统计聚合,减轻偏差并提高语音情感识别数据集中标签的可靠性。
  • 提供双领域数据集——表演类(平衡)和真实生活类(不平衡),以支持预训练和真实世界模型评估。
  • 发布完整的端到端流程,包括数据、预处理脚本和基线模型,降低语音情感识别研究的入门门槛。
  • 通过提供高质量、多语言适配的语料库,支持跨语言和迁移学习研究,尤其针对低资源语言(俄语)

提出的方法

  • 该数据集名为 Dusha,收集了约 350 小时的俄语语音,来源包括众包表演录音(255 小时)和真实播客录音(90 小时)。
  • 每个音频样本均配有转录文本,构成适合多模态情感识别的双模态数据集。
  • 情感类别分为四类:愤怒、快乐、中性与悲伤,每个样本由多名众包工作者标注。
  • 采用置信度阈值为 0.9 的 Dawid-Skene(DS)算法,将个体标注聚合为每个样本的单一高置信度标签。
  • 该聚合过程支持单标签与多标签输出,提升标签可靠性并减少标注偏差。
  • 基线模型采用梅尔频谱图(64 个滤波器组,20ms 窗口,10ms 重叠)、基于 MobileNetV2 的架构并加入自注意力层,使用 Adam 优化器训练 100 个周期,批量大小为 64。

实验结果

研究问题

  • RQ1能否构建一个足够多样化和真实感的大型俄语多模态语音情感识别数据集,以支持稳健的语音情感识别模型训练与评估?
  • RQ2置信度阈值为 0.9 的 Dawid-Skene 聚合机制在提升标签可靠性方面,相较于原始众包标注效果如何?
  • RQ3在 Dusha 的表演类子集上训练的基线模型,在泛化至播客中真实、非结构化音频时,表现如何?
  • RQ4在标准深度学习架构和标准评估协议下,使用 Dusha 基准可实现哪些性能指标(如 F1、准确率)?
  • RQ5在 Dusha 上训练的模型性能与在 IEMOCAP4 等成熟基准上训练的最先进模型相比如何?

主要发现

  • 经过聚合后,Dusha 数据集包含 230,177 个训练样本和 24,672 个测试样本,涵盖约 260 小时的训练音频和 28 小时的测试音频。
  • 表演类(众包)子集包含 164,387 个样本,四种类别情感分布相对均衡;而播客子集(90,462 个样本)则表现出中性情感的显著主导。
  • 基线模型在表演类测试集上达到 0.83 的未加权准确率(UA)和 0.77 的宏平均 F1 分数,表明在平衡子集上表现优异。
  • 在更具真实感的播客测试集上,模型达到 0.89 的 UA,但仅获得 0.53 的加权准确率(WA)和 0.54 的 F1 分数,反映出领域偏移和类别不平衡带来的挑战。
  • 在 IEMOCAP4 上训练的模型在五折交叉验证中达到 0.59 的 UA、WA 和 F1,可作为与 Dusha 结果对比的基线。
  • 标签聚合机制有效降低了众包标注中的噪声,90% 的样本置信度得分高于 0.9,确保了下游任务的高质量标签输出。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。