Skip to main content
QUICK REVIEW

[论文解读] EmoFake: An Initial Dataset for Emotion Fake Audio Detection

Yan Zhao, Jiangyan Yi|arXiv (Cornell University)|Nov 10, 2022
Music and Audio Processing被引用 4
一句话总结

本文提出了 EmoFake,这是首个用于情感伪造音频检测的公开数据集,包含真实情感语音以及通过七种开源情感语音转换(EVC)模型生成的伪造音频。本文提出 GADE 模型,采用基于深度情感嵌入的图注意力网络,在目标情感检测任务中实现了最先进性能,等错误率(EER)低至 0.51%,优于现有模型在新基准上的表现。

ABSTRACT

Many datasets have been designed to further the development of fake audio detection, such as datasets of the ASVspoof and ADD challenges. However, these datasets do not consider a situation that the emotion of the audio has been changed from one to another, while other information (e.g. speaker identity and content) remains the same. Changing the emotion of an audio can lead to semantic changes. Speech with tampered semantics may pose threats to people's lives. Therefore, this paper reports our progress in developing such an emotion fake audio detection dataset involving changing emotion state of the origin audio named EmoFake. The fake audio in EmoFake is generated by open source emotion voice conversion models. Furthermore, we proposed a method named Graph Attention networks using Deep Emotion embedding (GADE) for the detection of emotion fake audio. Some benchmark experiments are conducted on this dataset. The results show that our designed dataset poses a challenge to the fake audio detection model trained with the LA dataset of ASVspoof 2019. The proposed GADE shows good performance in the face of emotion fake audio.

研究动机与目标

  • 为解决缺乏专注于情感操纵伪造音频的数据集的问题,其中说话人身份和内容保持不变,仅情感被改变。
  • 构建一个基准数据集,以捕捉情感篡改带来的语义风险。
  • 评估现有伪造音频检测模型在面对情感伪造音频时的鲁棒性。
  • 提出并验证一种专为情感伪造音频设计的新检测方法 GADE。
  • 提供在 EmoFake 上训练的基线模型,以加速情感感知伪造音频检测的未来研究。

提出的方法

  • EmoFake 基于 ESD 数据集构建,使用五名男性和五名女性说话人,每人以五种情绪(中性、快乐、愤怒、悲伤、惊讶)各朗读 350 个句子。
  • 伪造音频通过七种开源 EVC 模型生成:VAW-GAN-CWT、DeepEST、Seq2seq-EVC、CycleGAN-EVC、CycleTransGAN、EmoCycleGAN 和 StarGAN-EVC。
  • GADE 利用图注意力网络建模跨语音样本之间的关系,并整合从预训练情感识别系统中提取的深度情感嵌入。
  • 该模型采用基于图的架构,以捕捉音频序列中的长距离依赖关系和情感不一致性。
  • 情感嵌入被用作图中的节点特征,通过注意力机制加权不同语音样本在检测伪造音频中的重要性。
  • 该框架在 EmoFake 数据集上端到端训练,并在未见的情感转换和 EVC 模型类型上进行评估。

实验结果

研究问题

  • RQ1当在仅情感被改变的伪造音频上测试时,现有伪造音频检测模型的性能如何下降?
  • RQ2哪些情感语音转换(EVC)模型生成的伪造音频最难以被标准检测模型识别?
  • RQ3像 GADE 这类专用模型是否能在情感伪造音频检测上超越通用伪造音频检测器?
  • RQ4目标情感的选择如何影响情感伪造音频的可检测性?
  • RQ5在 EmoFake 数据集上微调现有模型,能在多大程度上提升其对基于情感的操纵的鲁棒性?

主要发现

  • ASVspoof 2019 的 LA 数据集无法泛化到 EmoFake,所有测试模型在情感伪造音频上的 EER 均显著上升,表明性能出现明显下降。
  • GADE 在检测目标情感为 'Surprise' 的伪造音频时达到最低 EER(0.51%),在 'Happy' 情感下为 0.55%,优于所有基线模型。
  • LCNN 在情感伪造音频上的鲁棒性优于 ResNet34 和 SENet,后两者在所有情感转换中均出现严重性能下降。
  • 由 Seq2seq-EVC 模型(S3)生成的伪造音频最难检测,表明 EVC 模型的架构差异会影响可检测性。
  • 在 EmoFake 上微调的基线模型表现出更好的泛化能力,尤其 GADE 在所有情感转换中均保持强性能。
  • 检测模型的性能因目标情感而异,'Surprise' 情感最易被检测(RawNet2 的 EER 高达 7.26%),而 'Happy' 和 'Surprise' 对 SENet 和 ResNet34 来说最具挑战性。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。