Skip to main content
QUICK REVIEW

[论文解读] EnvGAN: Adversarial Synthesis of Environmental Sounds for Data Augmentation

Aswathy Madhu, Suresh Kumaraswamy|arXiv (Cornell University)|Apr 15, 2021
Music and Audio Processing参考文献 34被引用 4
一句话总结

本文提出EnvGAN,这是首个用于对抗性合成环境声音的生成对抗网络(GAN),以解决环境声音分类(ESC)中的数据稀缺问题。通过在时域中生成多样化且逼真的音频样本,EnvGAN显著提升了分类器性能,在ESC-10、UrbanSound8K和TUT Urban Acoustic Scenes 2018数据集上分别实现了最高0.965、0.9897和0.73的准确率提升,超越了当前最先进方法。

ABSTRACT

The research in Environmental Sound Classification (ESC) has been progressively growing with the emergence of deep learning algorithms. However, data scarcity poses a major hurdle for any huge advance in this domain. Data augmentation offers an excellent solution to this problem. While Generative Adversarial Networks (GANs) have been successful in generating synthetic speech and sounds of musical instruments, they have hardly been applied to the generation of environmental sounds. This paper presents EnvGAN, the first ever application of GANs for the adversarial generation of environmental sounds. Our experiments on three standard ESC datasets illustrate that the EnvGAN can synthesize audio similar to the ones in the datasets. The suggested method of augmentation outshines most of the futuristic techniques for audio augmentation.

研究动机与目标

  • 为解决深度学习应用中环境声音分类(ESC)存在的数据稀缺问题,这是主要瓶颈。
  • 开发一种基于GAN的新方法,用于合成保留语义内容的逼真环境声音。
  • 评估GAN生成数据作为数据增强策略在提升ESC模型泛化能力和鲁棒性方面的有效性。
  • 证明EnvGAN在ESC任务中优于传统和先进的数据增强技术。
  • 探索类别条件数据增强在进一步提升性能方面的潜力。

提出的方法

  • 提出一种时域GAN架构(EnvGAN),通过学习真实音频波形的潜在分布来生成环境声音。
  • 采用深度卷积神经网络(CNN)作为生成器,判别网络用于区分真实与生成的音频样本。
  • 使用最小最大损失函数训练生成器和判别器,以最小化真实数据与生成数据分布之间的Jensen-Shannon散度。
  • 将训练好的EnvGAN用于生成合成音频样本,并将其添加到原始训练集中以实现数据增强。
  • 使用高容量CNN模型作为基线分类器,在原始数据集和增强数据集上进行微调以评估性能。
  • 利用验证集识别类别特定的数据增强效果,实现选择性、基于性能的数据增强。

实验结果

研究问题

  • RQ1基于GAN的方法能否有效生成保留语义标签的逼真环境声音?
  • RQ2基于GAN的数据增强是否能提升深度学习模型在环境声音分类中的泛化能力和准确率?
  • RQ3在基准数据集上,EnvGAN生成的数据与传统和最先进音频增强技术相比,性能如何?
  • RQ4哪些类别从基于GAN的增强中获益最多或最少?类别条件增强是否能进一步提升模型性能?
  • RQ5EnvGAN能否通过生成合成样本有效处理如UrbanSound8K这样的类别不平衡数据集?

主要发现

  • EnvGAN成功生成了在感知上与ESC-10、UrbanSound8K和TUT Urban Acoustic Scenes 2018数据集的真实样本相似的环境声音。
  • 该方法在ESC-10上实现了0.965的测试准确率,比之前最先进模型高出0.0155。
  • 在UrbanSound8K上,模型准确率达到0.9897,显著优于次佳方法0.0145。
  • 在TUT Urban Acoustic Scenes 2018数据集上,模型达到0.73的准确率,表明其在更复杂多样的数据集上也表现出色。
  • 数据增强减少了某些类别间的混淆(如sea_waves与rain),但增加了其他类别间的混淆(如sea_waves与person_sneeze),表明存在类别特定影响。
  • 模型在类别不平衡数据集上表现出最显著的性能提升,证实EnvGAN在缓解数据不平衡方面的有效性。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。