Skip to main content
QUICK REVIEW

[论文解读] Sound Event Localization and Detection for Real Spatial Sound Scenes: Event-Independent Network and Data Augmentation Chains

Jinbo Hu, Yin Cao|arXiv (Cornell University)|Sep 5, 2022
Music and Audio Processing被引用 4
一句话总结

该论文提出了一种事件无关网络V2(EINV2),采用基于Conformer的特征提取方法和随机数据增强链,用于真实空间声景中的声音事件定位与检测(SELD)。通过利用FSD50K、AudioSet和TAU-SRIR DB的模拟数据,并应用多头自注意力机制与软参数共享策略,该方法在DCASE 2022年任务3挑战赛中获得第二名,展现出更强的泛化能力以及对类别不平衡和环境变化的鲁棒性。

ABSTRACT

Sound event localization and detection (SELD) is a joint task of sound event detection and direction-of-arrival estimation. In DCASE 2022 Task 3, types of data transform from computationally generated spatial recordings to recordings of real-sound scenes. Our system submitted to the DCASE 2022 Task 3 is based on our previous proposed Event-Independent Network V2 (EINV2) with a novel data augmentation method. Our method employs EINV2 with a track-wise output format, permutation-invariant training, and a soft parameter-sharing strategy, to detect different sound events of the same class but in different locations. The Conformer structure is used for extending EINV2 to learn local and global features. A data augmentation method, which contains several data augmentation chains composed of stochastic combinations of several different data augmentation operations, is utilized to generalize the model. To mitigate the lack of real-scene recordings in the development dataset and the presence of sound events being unbalanced, we exploit FSD50K, AudioSet, and TAU Spatial Room Impulse Response Database (TAU-SRIR DB) to generate simulated datasets for training. We present results on the validation set of Sony-TAu Realistic Spatial Soundscapes 2022 (STARSS22) in detail. Experimental results indicate that the ability to generalize to different environments and unbalanced performance among different classes are two main challenges. We evaluate our proposed method in Task 3 of the DCASE 2022 challenge and obtain the second rank in the teams ranking. Source code is released.

研究动机与目标

  • 解决真实空间声景中声音事件定位与检测(SELD)的挑战,其中合成数据分布与真实世界条件不一致。
  • 通过采用事件无关的逐轨输出格式,克服现有模型在区分同一类别事件在不同位置时的局限性(同类别重叠问题)。
  • 提升模型在多样化环境中的泛化能力,并缓解真实场景录音中类别不平衡导致的性能下降。
  • 开发一种新颖的数据增强策略,通过随机链式组合多种增强操作,提升特征多样性与鲁棒性。
  • 利用外部数据集(FSD50K、AudioSet)和实测房间脉冲响应(TAU-SRIR DB)生成逼真的模拟训练数据,以增强模型性能。

提出的方法

  • 采用事件无关网络V2(EINV2),采用逐轨输出格式,使每个轨道独立预测一个声音事件,从而支持在不同位置检测同一类别事件。
  • 整合多头自注意力(MHSA)与跨轨道的软参数共享策略,以实现多任务学习并提升泛化能力。
  • 通过引入结合卷积与自注意力机制的Conformer模块扩展EINV2,以捕捉局部与全局的时频特征。
  • 实现一种新颖的数据增强方法,采用随机链式组合的增强操作,将多个操作随机采样并叠加,生成多样化的训练样本。
  • 通过随机卷积方式将FSD50K和AudioSet中的声音事件与TAU-SRIR DB中的实测房间脉冲响应结合,生成模拟训练数据,以模拟真实空间声场场景。
  • 使用对数梅尔谱图和对数梅尔域中的强度向量(IVs)作为输入特征,直接从原始波形通过一维卷积层提取,以支持端到端的数据增强。

实验结果

研究问题

  • RQ1如何使声音事件定位与检测模型在多样化的真实声学环境中具备更强的泛化能力?
  • RQ2当训练数据有限或与真实测试条件不匹配时,数据增强链在多大程度上能提升模型泛化能力?
  • RQ3采用软参数共享机制的事件无关网络能否有效检测同一声音类别在不同空间位置的多个实例?
  • RQ4在真实空间声景中,基于模拟数据训练的模型性能与基于官方合成混音训练的模型相比如何?
  • RQ5在真实场景中,面对类别分布不平衡和复杂空间关系时,SELD系统性能下降的主要原因是什么?

主要发现

  • 所提系统在DCASE 2022年任务3挑战赛中取得第二名,优于官方基线模型。
  • 采用数据增强链的EINV2相比无增强的EINV2显著提升了性能,验证了随机增强链的有效性。
  • 在20°空间阈值下,'knock'类别的F1得分为80.0%,但'water tap and faucet'类别的F1得分仅为2.2%,表明存在显著的类别性能不平衡。
  • 定位性能在房间2最差,可能由于其尺寸较小;'walk, footsteps'类别在房间24的定位召回率为0.0%,暗示合成数据质量存在问题。
  • 在房间24中,'water tap and faucet'类别的性能显著下降,归因于对干扰事件(如'dishes, pots, and pans')在时间和空间上共现关系的模拟不佳。
  • 基于FSD50K、AudioSet和TAU-SRIR DB生成的模拟数据比官方合成混音更有效,凸显了真实感数据增强的价值。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。