Skip to main content
QUICK REVIEW

[论文解读] The ICML 2022 Expressive Vocalizations Workshop and Competition: Recognizing, Generating, and Personalizing Vocal Bursts

Alice Baird, Panagiotis Tzirakis|arXiv (Cornell University)|May 3, 2022
Speech Recognition and Synthesis被引用 7
一句话总结

本论文介绍了 ICML 2022 ExVo 竞赛,这是一项大规模的倡议,专注于使用来自四个国家的 1,702 名说话者的 59,201 个自然环境下的语音爆发数据集(Hume-VB),实现对表达性语音爆发的识别、生成与个性化。该竞赛包含三个赛道:多任务情绪与人口统计识别、情绪语音爆发的生成建模,以及少样本个性化。报告了基线分数:多任务学习为 0.335,生成质量(S_Gen)为 0.174,少样本情绪预测的 CCC 为 0.444。

ABSTRACT

The ICML Expressive Vocalization (ExVo) Competition is focused on understanding and generating vocal bursts: laughs, gasps, cries, and other non-verbal vocalizations that are central to emotional expression and communication. ExVo 2022, includes three competition tracks using a large-scale dataset of 59,201 vocalizations from 1,702 speakers. The first, ExVo-MultiTask, requires participants to train a multi-task model to recognize expressed emotions and demographic traits from vocal bursts. The second, ExVo-Generate, requires participants to train a generative model that produces vocal bursts conveying ten different emotions. The third, ExVo-FewShot, requires participants to leverage few-shot learning incorporating speaker identity to train a model for the recognition of 10 emotions conveyed by vocal bursts. This paper describes the three tracks and provides performance measures for baseline models using state-of-the-art machine learning strategies. The baseline for each track is as follows, for ExVo-MultiTask, a combined score, computing the harmonic mean of Concordance Correlation Coefficient (CCC), Unweighted Average Recall (UAR), and inverted Mean Absolute Error (MAE) ($S_{MTL}$) is at best, 0.335 $S_{MTL}$; for ExVo-Generate, we report Fréchet inception distance (FID) scores ranging from 4.81 to 8.27 (depending on the emotion) between the training set and generated samples. We then combine the inverted FID with perceptual ratings of the generated samples ($S_{Gen}$) and obtain 0.174 $S_{Gen}$; and for ExVo-FewShot, a mean CCC of 0.444 is obtained.

研究动机与目标

  • 为解决机器学习研究中非语言语音爆发的显著空白,这些语音爆发是情感表达的核心,但因数据稀缺而研究不足。
  • 实现对表达性语音爆发(如笑声、喘息声、哭喊声)的大规模、真实世界建模,超越对单一情绪类别的粗粒度分类。
  • 提供一个基准,用于多任务学习、生成建模和语音爆发的少样本个性化,使用一个多样化、自然环境下的数据集。
  • 通过发布一个大规模、多语言、多文化的语音爆发数据集,并附带连续情绪强度标注,加速情感计算研究。
  • 为三个新型机器学习挑战建立基线性能指标:情绪语音爆发的识别、生成,以及说话人感知的少样本预测。

提出的方法

  • Hume-VB 数据集包含来自美国、中国、南非和委内瑞拉的 1,702 名说话者在自然家庭环境中录制的 59,201 个语音爆发,具有多样的声学条件。
  • 对于 ExVo-MultiTask,采用多任务学习模型预测 10 个连续情绪维度(如愉悦、恐惧)、年龄和母语国家,使用基于 CCC、UAR 和反向 MAE 调和平均值的综合得分(S_MTL)进行评估。
  • 对于 ExVo-Generate,训练一个条件生成对抗网络(cGAN)以生成传达特定情绪的语音爆发,性能通过 Fréchet Inception 距离(FID)和感知评分(S_Gen)评估。
  • 对于 ExVo-FewShot,采用具有 256 个隐藏单元的两层 LSTM,在仅使用每个说话人两个样本的少样本设置下预测 10 个情绪维度,性能通过组内相关系数(CCC)衡量。
  • 基线模型采用最先进技术:使用 ExtraAdam 优化器提升训练稳定性,并通过数据筛选(如限制为美国样本)改善生成模型的收敛性。
  • 评估包括生成样本与真实样本之间的 FID、感知评分(HEEP),以及回归任务的 CCC,结果按情绪和总体分别报告。

实验结果

研究问题

  • RQ1多任务模型能否从表达性语音爆发中联合识别出 10 个连续情绪维度、年龄和母语国家?
  • RQ2生成模型能否产生高保真度的语音爆发,使其在情感内容和声学质量上与真实语音爆发相匹配,涵盖多种情绪?
  • RQ3在仅使用两个说话人样本的情况下,少样本学习模型在多大程度上能准确预测语音爆发中的情绪强度?
  • RQ4数据多样性(如语言、录音条件)如何影响语音爆发生成与识别模型的性能和训练稳定性?
  • RQ5使用最先进深度学习方法时,表达性语音爆发的识别、生成和个性化任务的基线性能水平如何?

主要发现

  • ExVo-MultiTask 基线模型的综合得分(S_MTL)为 0.335,代表情绪、年龄和人口统计预测中 CCC、UAR 和反向 MAE 的调和平均值。
  • 对于 ExVo-Generate,不同情绪的基线 FID 分数在 4.81 到 8.27 之间,其中愉悦和敬畏类别的 FID 最低,表明这些类别的生成质量更优。
  • 通过 HEEP 测量的生成样本感知质量,整合为 S_Gen 指标,所有情绪的基线得分为 0.174,愉悦类达到峰值 0.347。
  • ExVo-FewShot 基线模型使用 256 个隐藏单元的 LSTM,平均 CCC 达到 0.444 ± 0.006,优于 64 或 128 个隐藏单元的模型,表明更高的隐藏维度能更好地捕捉时间动态。
  • 通过将数据限制为美国样本,显著提升了生成模型的训练稳定性,表明不同地区的音频质量和噪声特征会影响模型收敛。
  • 在生成如胜利感和恐惧感等情绪的语音爆发方面仍存在巨大改进空间,表现为更高的 FID 和更低的 S_Gen 得分,凸显了建模复杂情感混合的挑战。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。