Skip to main content
QUICK REVIEW

[論文レビュー] EnvGAN: Adversarial Synthesis of Environmental Sounds for Data Augmentation

Aswathy Madhu, Suresh Kumaraswamy|arXiv (Cornell University)|Apr 15, 2021
Music and Audio Processing参考文献 34被引用数 4
ひとこと要約

この論文では、環境音分類(ESC)におけるデータ不足という課題に取り組むために、初めての敵対的生成ネットワーク(GAN)であるEnvGANを紹介する。時間領域で多様で現実的な音声サンプルを生成することで、EnvGANは分類器の性能を著しく向上させ、ESC-10、UrbanSound8K、TUT Urban Acoustic Scenes 2018のデータセットにおいて、それぞれ0.965、0.9897、0.73の精度向上を達成し、最先端手法を上回った。

ABSTRACT

The research in Environmental Sound Classification (ESC) has been progressively growing with the emergence of deep learning algorithms. However, data scarcity poses a major hurdle for any huge advance in this domain. Data augmentation offers an excellent solution to this problem. While Generative Adversarial Networks (GANs) have been successful in generating synthetic speech and sounds of musical instruments, they have hardly been applied to the generation of environmental sounds. This paper presents EnvGAN, the first ever application of GANs for the adversarial generation of environmental sounds. Our experiments on three standard ESC datasets illustrate that the EnvGAN can synthesize audio similar to the ones in the datasets. The suggested method of augmentation outshines most of the futuristic techniques for audio augmentation.

研究の動機と目的

  • ディープラーニングの応用において大きな障壁となっている、環境音分類(ESC)におけるデータ不足を解消すること。
  • 意味的コンテンツを保持した現実的な環境音を合成する、新しいGANベースの手法を開発すること。
  • GANで生成されたデータが、ESCモデルの汎化性能と耐性を向上させるデータ拡張戦略として有効であるかを評価すること。
  • EnvGANが従来および先進的なデータ拡張技術を上回ることを実証すること。
  • さらなる性能向上を図るため、クラス条件付き拡張の可能性を検討すること。

提案手法

  • 実際の音声波形の潜在分布を学習することで、時間領域で環境音を生成するGANアーキテクチャ(EnvGAN)を提案する。
  • 生成器として深層畳み込みニューラルネットワーク(CNN)を採用し、判別器ネットワークを用いて実際の音声と生成された音声を区別する。
  • 生成器と判別器を、実データ分布と生成データ分布の間のジェンセン・シャノン発散を最小化するように、ミニマックス損失関数を用いて訓練する。
  • 訓練されたEnvGANを用いて合成音声サンプルを生成し、元の訓練セットに追加することでデータ拡張を実施する。
  • ベースライン分類器として高容量のCNNモデルを用い、元のデータセットおよび拡張済みデータセットで微調整することで性能を評価する。
  • 検証セットを用いてクラスごとの拡張効果を特定し、性能指向の選択的データ拡張を可能にする。

実験結果

リサーチクエスチョン

  • RQ1GANベースのアプローチは、意味ラベルを保持した現実的な環境音を効果的に生成できるか?
  • RQ2GANベースのデータ拡張は、環境音分類におけるディープラーニングモデルの汎化性能と精度を向上させるか?
  • RQ3ベンチマークデータセット上での性能観点から、EnvGANで生成されたデータは従来および最先端の音声拡張技術と比べてどのように差がつくか?
  • RQ4どのクラスがGANベースの拡張によって最も/最も利益を得るか、またクラス条件付き拡張がさらに性能向上をもたらすか?
  • RQ5EnvGANは、UrbanSound8Kのようなクラス不均衡データセットを、合成サンプルの生成によって効果的に処理できるか?

主な発見

  • EnvGANは、ESC-10、UrbanSound8K、TUT Urban Acoustic Scenes 2018データセットからの実サンプルと聴覚的に類似した環境音を効果的に生成した。
  • 提案手法はESC-10でテスト精度0.965を達成し、以前の最先端モデルを0.0155上回った。
  • UrbanSound8Kでは0.9897の精度に達し、次に優れた手法よりも0.0145顕著に上回った。
  • TUT Urban Acoustic Scenes 2018データセットでは0.73の精度を達成し、より複雑で多様なデータセットにおいても強力な性能を示した。
  • 拡張により、特定のクラス間(例:sea_waves と rain)の混同が減少したが、他のクラス間(例:sea_waves と person_sneeze)では混同が増加したため、クラスに依存する効果が示された。
  • クラス不均衡データセットにおいて、特に顕著な性能向上が見られたことから、EnvGANがデータ不均衡の緩和に有効であることが確認された。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。