Skip to main content
QUICK REVIEW

[論文レビュー] SpecAugment++: A Hidden Space Data Augmentation Method for Acoustic Scene Classification

Helin Wang, Yuexian Zou|arXiv (Cornell University)|Mar 31, 2021
Music and Audio Processing被引用数 8
ひとこと要約

本稿では、音響シーン分類のための深層ニューラルネットワークにおける入力スペクトログ램および中間隠れ状態の両方に特徴マスキングを適用する新規なデータ拡張手法、SpecAugment++ を提案する。ゼロ値マスキングとミニバッチベースのマスキング方式(MM および CM)を用いることで、モデルの汎化性能とロバスト性が向上し、DCASE 2018 および 2019 データセットにおいて強力なベースラインよりそれぞれ 3.6% および 4.7% の精度向上を達成した。

ABSTRACT

In this paper, we present SpecAugment++, a novel data augmentation method for deep neural networks based acoustic scene classification (ASC). Different from other popular data augmentation methods such as SpecAugment and mixup that only work on the input space, SpecAugment++ is applied to both the input space and the hidden space of the deep neural networks to enhance the input and the intermediate feature representations. For an intermediate hidden state, the augmentation techniques consist of masking blocks of frequency channels and masking blocks of time frames, which improve generalization by enabling a model to attend not only to the most discriminative parts of the feature, but also the entire parts. Apart from using zeros for masking, we also examine two approaches for masking based on the use of other samples within the minibatch, which helps introduce noises to the networks to make them more discriminative for classification. The experimental results on the DCASE 2018 Task1 dataset and DCASE 2019 Task1 dataset show that our proposed method can obtain 3.6% and 4.7% accuracy gains over a strong baseline without augmentation (i.e. CP-ResNet) respectively, and outperforms other previous data augmentation methods.

研究の動機と目的

  • 限られた学習データによる過学習を緩和すること。
  • 入力スペクトログラムに加えて中間隠れ特徴表現の拡張により、モデルの汎化性能を向上させること。
  • ラベルの監視を変更せずに、隠れ空間におけるマスキング戦略がロバスト性を向上させるかを検討すること。
  • ゼロ値マスキングおよびミニバッチベースのマスキング(MM/CM)がモデル性能に与える影響を評価すること。
  • 隠れ空間拡張における最適なマスキング比と層選択を特定すること。

提案手法

  • CNN の各層における中間特徴マップおよび入力のログメルスペクトログラムの両方に、時間方向マスキングおよび周波数方向マスキングを適用する。
  • 3 種類のマスキング方式を用いる:ゼロ値マスキング(ZM)、ミニバッチベースのミキシングマスキング(MM)、ミニバッチベースのカットマスキング(CM)。
  • MM は、同じミニバッチ内の他のサンプルからの対応する時間/周波数成分でマスキング領域を置き換えることで、自然な雑音を導入する。
  • CM は、マスキング領域を他のサンプルからの不連続なセグメントで置き換えることで、アーチファクトを引き起こす可能性がある。
  • この手法は複数のネットワーク層に適用され、入力層や初期層の拡張が、高層の拡張よりもより大きな向上をもたらす。
  • 拡張処理中はラベルを変更せず、mixup や BC 学習と異なり、学習の安定性を保証する。

実験結果

リサーチクエスチョン

  • RQ1入力空間の拡張を超えて、中間隠れ状態の拡張が音響シーン分類の汎化性能を向上させられるか?
  • RQ2ゼロ値マスキング、ミニバッチベースのミキシング、ミニバッチベースのカットマスキングといった異なるマスキング戦略が、モデルのロバスト性と精度に与える影響は何か?
  • RQ3入力空間および隠れ空間における時間および周波数マスキングの最適なマスキング比は何か?
  • RQ4性能向上の観点から、どのネットワーク層が隠れ空間拡張において最も利益を得られるか?
  • RQ5入力空間と隠れ空間の両方の拡張を組み合わせることで、既存の最先端データ拡張技術を上回れるか?

主な発見

  • SpecAugment++ は DCASE 2018 データセットで CP-ResNet ベースラインを 3.6% 上回り、DCASE 2019 データセットでは 4.7% の精度向上を達成し、先行手法を上回った。
  • ミニバッチベースのミキシングマスキング(MM)方式は、常にゼロ値マスキング(ZM)を上回り、バッチ内の実際のデータを用いることでロバスト性が向上することを示している。
  • 時間および周波数マスキングの最適なマスキング比は 10% から 25% の間であり、これ以上になると情報損失が顕著になり、性能が低下する。
  • 初期層(例:層 0 や 1)の拡張が、後段の層の拡張よりも顕著な性能向上をもたらす。これは、これらの層がより知覚的に重要な特徴を捉えているためである。
  • 入力と隠れ状態の両方の層に拡張を適用すると最良の性能が得られ、MM では DCASE 2019 で 82.6% の精度を達成した。
  • 本手法は計算的に効率的で安定しており、mixup や BC 学習とは異なり、元のラベルを保持するため、学習の安定性が保たれる。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。