Skip to main content
QUICK REVIEW

[論文レビュー] Auditory Machine Learning Training and Testing Pipeline: AMLTTP v3.0

Ivo Trowitzsch, Youssef Kashef|arXiv (Cornell University)|Feb 21, 2019
Music and Audio Processing参考文献 8被引用数 12
ひとこと要約

この論文では、1,017件の分離済みの高品質な音響イベント(14クラス、例:アラーム、犬の鳴き声、ピアノなど)に加え、303件の一般的な音声を含む、公開可能な音声データベースNIGENSを紹介している。すべての音声には正確な発音・停止時刻のアノテーションが付与されており、音声イベント検出のための強固なモデル訓練・テストを可能にする。AMLTTP v3.0により、パイプライン統合と複雑な音響シーンの合成が実現される。

ABSTRACT

NIGENS (<strong>N</strong>eural <em><strong>I</strong></em>nformation Processing group <em><strong>GEN</strong></em>eral sounds) is a database provided for sound-related modeling in the field of computational auditory scene analysis, particularly for sound event detection, that has emerged from the Two!Ears project. It contains 1017 wav files of various lengths (between 1s and 5mins), in total comprising 4h:46m of sound material. Mostly, sounds are provided with 32-bit precision and 44100 Hz sampling rate. The files contain sound events in isolation, i.e. without superposition of ambient or other foreground sources. Fourteen distinct sound classes are included: <em>alarm</em>, <em>crying baby</em>, <em>crash</em>, <em>barking dog</em>, <em>running engine</em>, <em>burning fire</em>, <em>footsteps</em>, <em>knocking on door</em>, <em>female</em> and <em>male speech</em>, <em>female</em> and <em>male scream</em>, <em>ringing phone</em>, <em>piano</em>. Additionally, there is the <em>general</em> (“anything else”) class. Care has been taken to select sound classes representing different features, like noise-like or pronounced, discrete or continuous. The <em>general</em> class is a pool of sound events different than the 14 distuingished target sound classes, containing as heterogeneous sounds as possible (303 in total). For example, it includes nature sounds such as wind, rain, or animals, sounds from human-made environments such as honks, doors, or guns, as well as human sounds like coughs. These sounds are intended both as ``disturbance'' sound events (superposing) and as counterexamples to target sound classes.<br> <br> Wav files are accompanied by annotation (.txt) files that include perceptual on- and offset times of the file's sound events. You are free to use this database non-commercially under Creative Commons Attribution-NonCommercial-NoDerivatives 4.0 license. <strong>If you use this data set, please cite as:</strong> <strong>Ivo Trowitzsch, Jalil Taghia, Youssef Kashef, and Klaus Obermayer (2019). <em>The NIGENS general sound events database</em>. Technische Universität Berlin, Tech. Rep. arXiv:1902.08314 [cs.SD] </strong> In [1], we have developed and analyzed a robust binaural sound event detection training scheme using NIGENS. In [2], we have extended it to join sound event detection and localization through spatial segregation. [1] Trowitzsch, I., Mohr, J., Kashef, Y., Obermayer, K. (2017). <em>Robust detection of environmental sounds in binaural auditory scenes</em>. IEEE/ACM Transactions on Audio, Speech, and Language Processing 25(6). [2] Trowitzsch, I., Schymura, C., Kolossa, D., Obermayer, K. (2019). <em>Joining Sound Event Detection and Localization Through Spatial Segregation</em>. accepted for publication in IEEE/ACM Transactions on Audio, Speech, and Language Processing. DOI: 10.1109/TASLP.2019.2958408. E-Preprint: arXiv:1904.00055 [cs.SD].

研究の動機と目的

  • 一般音声イベント検出(SED)研究における、高品質で分離済みの音声イベントデータベースの不足を解消すること。
  • モデルの訓練精度を向上させるために、知覚的に整合した発音・停止時刻の正確なアノテーションを提供すること。
  • 未知の音声イベントが発生する現実世界の状況を模擬するため、多様な「一般」クラスを含めること。
  • 未知の干渉要因や複雑な音響シーンに対応できる強固なSEDモデルの開発を支援すること。
  • 明確なライセンスを備えた公開可能で、詳細にアノテートされたデータセットを通じて、標準化されたベンチマークと再現可能な研究を可能にすること。

提案手法

  • StockMusic.com から 714 件の分離音声ファイル、Freesound.org から 303 件の一般的な音声を収集し、すべて 32 ビット、44.1 kHz の高精細なサンプリングを実施。
  • 知覚的発音・停止時刻を明確にマークする厳密なアノテーション基準を適用し、間に挟まる無音部分を除外することで、イベントの分離を確保。
  • 14 のターゲットクラス(例:アラーム、乳児の泣き声、エンジンなど)と、すべての非ターゲット音声を含む「一般」クラスにデータセットを構成。
  • 音声機械学習トレーニング・テストパイプライン(AMLTTP v3.0)を用いて、ファイルリスト、アノテーション、音声を処理し、モデルの訓練を実施。
  • AMLTTP を用いて、空間的・時間的制御を加えた分離イベントの組み合わせにより、複雑な多音性音響シーンを生成。
  • バイナリナル1ソースシーンの500 ms セグメントにおける分類率の混同行列を用いて、モデルの性能を検証。

実験結果

リサーチクエスチョン

  • RQ1大規模かつ高品質で分離済みの音声イベントデータベースを、強固な音声イベント検出研究を支援する形で構築するにはどうすればよいか?
  • RQ2知覚的に正確な発音・停止時刻のアノテーションは、モデルの汎化性能および検出性能をどの程度向上させるか?
  • RQ3多様な「一般」音声クラスを含めることで、未知または語彙外の音声イベントに対するモデルの頑健性はどの程度向上するか?
  • RQ4AMLTTP v3.0 は、多音性アノテーション付きの複雑な音響シーンモデルの訓練・テストに、NIGENS を効果的に統合できるか?
  • RQ5分類の混同パターンから示されるように、ターゲット音声クラス間の音響的重複度はどの程度か?

主な発見

  • NIGENS には合計 1,017 件の音声ファイルが含まれ、合計長は 4 時間 45 分 12 秒。14 クラスにまたがる 714 件の分離イベントと、303 件の一般音声ファイルが含まれる。
  • 女性の声モデルは、実際の女性の声セグメントで 99% の検出率を達成しており、高いモデル感度を示している。
  • 誤分類率の分析から、顕著な音響的重複が確認された。例えば、女性の声モデルはピアノセグメントの 10% を誤って分類した。
  • 一般音声クラスは、非ターゲット音声の多様性を反映して、広帯域で構造のないスペクトルを示している。
  • 持続スペクトルは、時間的・周波数的構造を効果的に可視化しており、アラームと電話、エンジンと火災の間で類似性が確認された。
  • 非ターゲットの「一般」音声の組み込みにより、現実世界の音響複雑性と未知の干渉要因を模擬することで、モデルの頑健性が向上した。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。