Skip to main content
QUICK REVIEW

[論文レビュー] ACGAN-based Data Augmentation Integrated with Long-term Scalogram for Acoustic Scene Classification

Hangting Chen, Zuozhen Liu|arXiv (Cornell University)|May 27, 2020
Music and Audio Processing参考文献 46被引用数 6
ひとこと要約

本論文は、音響シーン分類(ASC)のための、長期間スコセグラム特徴と統合されたACGANベースのデータ拡張フレームワークを提案しており、モデルの汎化性能と精度を顕著に向上させた。ウェーブレットに基づく長期間スペクトル表現と反復的でフィルタ最適化されたGANによる合成サンプルを活用することで、本手法はDCASE2019コンテストで85.16%の精度を達成し、1位を獲得した。

ABSTRACT

In acoustic scene classification (ASC), acoustic features play a crucial role in the extraction of scene information, which can be stored over different time scales. Moreover, the limited size of the dataset may lead to a biased model with a poor performance for records from unseen cities and confusing scene classes. In order to overcome this, we propose a long-term wavelet feature that requires a lower storage capacity and can be classified faster and more accurately compared with classic Mel filter bank coefficients (FBank). This feature can be extracted with predefined wavelet scales similar to the FBank. Furthermore, a novel data augmentation scheme based on generative adversarial neural networks with auxiliary classifiers (ACGANs) is adopted to improve the generalization of the ASC systems. The scheme, which contains ACGANs and a sample filter, extends the database iteratively by splitting the dataset, training the ACGANs and subsequently filtering samples. Experiments were conducted on datasets from the Detection and Classification of Acoustic Scenes and Events (DCASE) challenges. The results on the DCASE19 dataset demonstrate the improved performance of the proposed techniques compared with the classic FBank classifier. Moreover, the proposed fusion system achieved first place in the DCASE19 competition and surpassed the top accuracies on the DCASE17 dataset.

研究の動機と目的

  • 小さな不均衡なデータセットによる、未確認の都市や紛らわしいシーンクラスにおけるASCモデルの一般化性能の低さを是正すること。
  • 短期間FBank特徴よりも、複数スケールの音響手がかりをより効果的に捉えることができる、長期間ウェーブレット特徴(スコセグラム)の開発。
  • クラスラベルに条件づけられた生成器を用いる反復的でACGANベースのデータ拡張スキームを設計し、多様で高品質な合成音声サンプルを生成すること。
  • 敵対的学習とDCTベースのモジュールを用いた時間的モデリングにより、モデルの頑健性を向上させること。
  • 特徴融合とシステムアンサンブルを用いることで、DCASEベンチマークデータセットで最先端の性能を達成すること。

提案手法

  • 長期間スコセグラムは、STFTスペクトルに事前に定義されたウェーブレットスケールを適用することで抽出され、従来のFBank特徴に置き換えられる。
  • ACGANベースのデータ拡張スキームが採用され、生成器はクラスラベルに条件づけられた合成音声サンプルを生成する。
  • データセットは都市ごとに分割され、既知の都市で学習を行い、未知の都市で評価することで、汎化性能の向上が図られる。
  • 各ACGAN学習イテレーション後にサンプルフィルタが適用され、高品質な合成サンプルが選別され、反復的拡張におけるデータ品質が保証される。
  • 敵対的学習とDCTベースの時間的モジュールを統合することで、特徴表現の向上と過学習の低減が図られる。
  • 複数の分類器(DCNN、FCNN)が平均投票を用いて統合され、スコセグラムとFBank特徴の最適な融合比(1:2)が特定された。

実験結果

リサーチクエスチョン

  • RQ1ウェーブレット変換から導出される長期間スコセグラム特徴は、短期間FBank特徴よりも、複数スケールの音響シーン手がかりを効果的に捉えられるか?
  • RQ2サンプルフィルタを備えたACGANベースのデータ拡張は、ASCにおける未確認都市や紛らわしいシーンクラスの一般化性能を向上させるか?
  • RQ3敵対的学習とDCTベースの時間的モデリングの統合は、モデルの頑健性と性能にどのように影響を与えるか?
  • RQ4長期間スコセグラムと短期間FBank特徴の間で最適な統合戦略は何か?
  • RQ5提案されたフレームワークは、DCASEベンチマークデータセットで最先端の性能を達成できるか?

主な発見

  • 提案された長期間スコセグラム特徴は、FBankよりも高い精度を達成し、特にリズミカルで持続的な環境音の手がかりを捉える点で優れた性能を示した。
  • 反復的フィルタリングを備えたACGANベースのデータ拡張スキームにより、特に未確認都市の録音データに対してモデルの一般化性能が向上した。
  • スコセグラムとFBank特徴を1:2の比率で融合した結果、DCASE2019 fold-1テストセットで85.16%の精度を達成した。
  • 統合後、DCASE17の最良手法を1.3%上回る84.57%の精度を達成した。
  • 敵対的学習とDCTベースの時間的モジュールは訓練損失を低減したが、過学習を避けるために慎重なチューニングが必要であった。
  • 本手法はDCASE2019コンテストで1位を獲得し、多様な音響シーンにおいて優れた一般化性能と頑健性を示した。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。