[论文解读] A Strongly-Labelled Polyphonic Dataset of Urban Sounds with Spatiotemporal Context
本论文介绍了 SINGA:PURA,这是一个通过新加坡无线声学传感器网络收集的、具有时空元数据和分层标签分类法的强标签多音城市声音数据集,包含6,547个真实世界录音。该数据集支持先进的城市声音标记、检测与定位任务,基线模型在14类分类任务上的微平均AUPRC达到0.7064,证明其在真实世界音频人工智能应用中的实用性。
This paper introduces SINGA:PURA, a strongly labelled polyphonic urban sound dataset with spatiotemporal context. The data were collected via several recording units deployed across Singapore as a part of a wireless acoustic sensor network. These recordings were made as part of a project to identify and mitigate noise sources in Singapore, but also possess a wider applicability to sound event detection, classification, and localization. This paper introduces an accompanying hierarchical label taxonomy, which has been designed to be compatible with other existing datasets for urban sound tagging while also able to capture sound events unique to the Singaporean context. This paper details the data collection, annotation, and processing methodologies for the creation of the dataset. We further perform exploratory data analysis and include the performance of a baseline model on the dataset as a benchmark.
研究动机与目标
- 为解决缺乏公开可用、真实世界、具有时空上下文的强标签城市声音数据集的问题,以训练鲁棒的深度学习模型。
- 开发一种与现有城市声音数据集(如 SONYC-UST)兼容的分层标签分类法,同时捕捉新加坡特有的声音事件。
- 在复杂的城市声学环境中支持先进的音频任务,如声音事件检测、分类与定位。
- 提供一个基准数据集,用于评估基于真实、多音城市声音录音训练的模型,减少由合成数据引起的协变量偏移。
- 通过数据驱动方法支持城市环境中噪声源的识别与缓解工作。
提出的方法
- 数据通过部署在新加坡的无线声学传感器网络收集,包括单通道和多通道录音设备。
- 每段录音均使用包含14个粗粒度类别和56个细粒度类别的分层分类法进行强标签标注。
- 为每段录音附加了时空元数据(位置、时间、传感器ID),以支持上下文感知分析。
- 该数据集包含6,547个强标签录音和72,406个未标签录音,重点关注多音声音事件。
- 基线模型源自 DCASE 2020 挑战赛的模型,针对 SINGA:PURA 进行微调,输出层设为14类以实现粗粒度分类。
- 模型评估采用微平均和宏平均的AUPRC与F1分数,同时报告各类别的AUPRC以进行详细性能分析。
实验结果
研究问题
- RQ1如何系统性地大规模收集并标注具有时空上下文的真实世界多音城市声音数据集?
- RQ2分层标签分类法在多大程度上增强了与现有城市声音数据集的兼容性,同时捕捉了城市特有的声学现象?
- RQ3基线深度学习模型在具有复杂多音性和时空上下文的真实世界强标签城市声音数据集上的表现如何?
- RQ4真实城市录音中多音事件的分布(如重叠声音数量)与合成数据或简单数据集相比有何差异?
- RQ5在多城市数据集(如 SONYC-UST)上训练的模型,能否泛化到具有不同声音事件分布的新城市环境(如新加坡)?
主要发现
- SINGA:PURA 数据集包含6,547个带有时空元数据的强标签录音,来自新加坡真实无线声学传感器网络的采集。
- 该数据集具有包含14个粗粒度类别和56个细粒度类别的分层标签分类法,既与 SONYC-UST 兼容,又能捕捉新加坡特有的城市声音。
- 最常见的多音程度为每段录音包含两个事件,最多可达七个事件重叠,且当事件数超过三个后,多音分布呈指数下降。
- 基线模型在 SINGA:PURA 数据集上的微平均AUPRC为0.7064,微平均F1得分为0.4811,表明其在复杂真实城市声音分类任务中表现中等。
- 某些类别表现显著不佳:动力锯(AUPRC 0.0220)和刹车声(0.1649)检测效果差,而人声(0.8708)和发动机声(0.8706)则被良好分类。
- 共现矩阵显示某些声音类别之间存在强相关性(如发动机声、警报信号与人声),而其他类别之间共现率较低(如水流声与机械撞击或动力锯声)。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。