Skip to main content
QUICK REVIEW

[論文レビュー] A Strongly-Labelled Polyphonic Dataset of Urban Sounds with Spatiotemporal Context

Kenneth Ooi, Karn N. Watcharasupat|arXiv (Cornell University)|Nov 3, 2021
Music and Audio Processing参考文献 20被引用数 6
ひとこと要約

本論文では、シンガポールのワイヤレス音響センサーネットワークを活用して収集された6,547件の実世界の記録を含む、空間的・時間的メタデータおよび階層的ラベル分類法を備えた、強力ラベル付きで多音源の都市音響データセットSINGA:PURAを紹介する。このデータセットは、高度な都市音声タギング、検出、局所化タスクを可能にし、14クラス分類タスクにおいてマイクロ-AUPRCが0.7064に達するベースラインモデルを提示することで、実世界の音声AI応用分野における実用性を示している。

ABSTRACT

This paper introduces SINGA:PURA, a strongly labelled polyphonic urban sound dataset with spatiotemporal context. The data were collected via several recording units deployed across Singapore as a part of a wireless acoustic sensor network. These recordings were made as part of a project to identify and mitigate noise sources in Singapore, but also possess a wider applicability to sound event detection, classification, and localization. This paper introduces an accompanying hierarchical label taxonomy, which has been designed to be compatible with other existing datasets for urban sound tagging while also able to capture sound events unique to the Singaporean context. This paper details the data collection, annotation, and processing methodologies for the creation of the dataset. We further perform exploratory data analysis and include the performance of a baseline model on the dataset as a benchmark.

研究の動機と目的

  • 実世界の、空間的・時間的文脈を備えた、強力ラベル付きの都市音響データセットが不足している現状に対処するため。
  • SONYC-USTなどの既存の都市音響データセットと互換性を持つ階層的ラベル分類法を構築する一方で、シンガポール独自の音響現象を捉えること。
  • 複雑な都市音響環境における音声イベント検出、分類、局所化などの高度な音声タスクを可能にすること。
  • 合成データからの分布シフト(covariate shift)を低減するため、実際の多音源都市音響記録に基づいたベンチマークデータセットを提供すること。
  • データ駆動型の手法を用いて、都市環境におけるノイズ源の同定と低減を支援すること。

提案手法

  • データはシンガポール全域に展開されたワイヤレス音響センサーネットワークを用いて収集され、単一チャネルおよびマルチチャネルの記録ユニットを含む。
  • 各記録は、14の粗いレベルのクラスと56の細かいレベルのクラスを含む階層的分類法を用いて強力ラベルが付与された。
  • 空間的・時間的メタデータ(位置、時刻、センサID)が各記録に付加され、文脈に配慮した分析を可能にした。
  • データセットには6,547件の強力ラベル付き記録と72,406件のラベルなし記録が含まれており、多音源音声イベントに焦点を当てている。
  • ベースラインモデルはDCASE 2020チャレンジのモデルを改変し、SINGA:PURAで微調整し、粗いレベル分類のための14クラス出力層を採用した。
  • モデル評価にはマイクロ平均およびマクロ平均のAUPRCとF1スコアが用いられ、詳細なパフォーマンス分析のためクラスごとのAUPRCが報告された。

実験結果

リサーチクエスチョン

  • RQ1空間的・時間的文脈を備えた実世界の多音源都市音響データセットを、スケールに応じて体系的かつ正確に収集・ラベリングする方法は何か?
  • RQ2階層的ラベル分類法は、既存の都市音響データセットとどれほど互換性を持つようになるか。同時に、都市固有の音響現象をどれほど的確に捉えることができるか?
  • RQ3実世界の強力ラベル付き都市音響データセットにおいて、複雑な多音源性と空間的・時間的文脈を伴う状況下で、ベースラインディープラーニングモデルのパフォーマンスはどの程度か?
  • RQ4実際の都市記録における多音源イベントの分布(例:重複する音の数)は、合成データや単純なデータセットと比べてどのように異なるか?
  • RQ5複数都市をカバーするデータセット(SONYC-UST)で学習したモデルは、音声イベントの分布が異なる新しい都市環境(シンガポール)に一般化できるか?

主な発見

  • SINGA:PURAデータセットには、シンガポール全域のワイヤレス音響センサーネットワークから収集された6,547件の強力ラベル付き記録と、空間的・時間的メタデータが含まれる。
  • 14の粗いレベルクラスと56の細かいレベルクラスを有する階層的ラベル分類法を備えており、SONYC-USTと互換性を持つ一方で、シンガポール独自の都市音響を捉えることができる。
  • 最も一般的な多音源度は1件の記録あたり2つのイベントであり、最大で7つの重複イベントが観察された。3つ以上のイベントが重複する場合、多音源度の分布は3を超えて急激に減少する。
  • ベースラインモデルはSINGA:PURAデータセットでマイクロ-AUPRCが0.7064、マイクロ-F1スコアが0.4811を達成し、複雑な実世界の都市音声分類タスクにおいて中程度のパフォーマンスを示した。
  • 特定のクラスでは顕著なパフォーマンス格差が観察された:電動のこぎり(AUPRC 0.0220)とブレーキ音(0.1649)は著しく検出が困難であった一方、人間の声(0.8708)とエンジン音(0.8706)は良好に分類された。
  • 共起行列の分析から、エンジン音、アラート信号、人間の声といった特定の音声クラス間に強い相関関係が確認されたが、水音と機械的衝撃音や電動のこぎり音との間には共起がほとんど見られなかった。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。