Skip to main content
QUICK REVIEW

[论文解读] Beyond Equal-Length Snippets: How Long is Sufficient to Recognize an Audio Scene?

Huy Phan, Oliver Y. Chén|Kent Academic Repository (University of Kent)|Nov 2, 2018
Music and Audio Processing参考文献 21被引用 6
一句话总结

本研究探讨了不同长度的音频片段在音频场景识别中的应用,发现识别可靠性在不同场景类别间差异显著,部分场景可在20秒内识别,而其他场景则需30秒以上。模型融合,尤其是后融合(late fusion),在短信号长度下性能提升最大,表明自适应的听音时长可提高系统效率与准确性。

ABSTRACT

Due to the variability in characteristics of audio scenes, some scenes can naturally be recognized earlier than others. In this work, rather than using equal-length snippets for all scene categories, as is common in the literature, we study to which temporal extent an audio scene can be reliably recognized given state-of-the-art models. Moreover, as model fusion with deep network ensemble is prevalent in audio scene classification, we further study whether, and if so, when model fusion is necessary for this task. To achieve these goals, we employ two single-network systems relying on a convolutional neural network and a recurrent neural network for classification as well as early fusion and late fusion of these networks. Experimental results on the LITIS-Rouen dataset show that some scenes can be reliably recognized with a few seconds while other scenes require significantly longer durations. In addition, model fusion is shown to be the most beneficial when the signal length is short.

研究动机与目标

  • 探究音频场景识别性能是否随信号长度在不同场景类别间发生变化,以挑战使用固定长度片段的常见做法。
  • 确定模型融合(早期融合与后期融合)在音频场景分类中何时及如何最有益。
  • 评估信号时长对集成模型在音频场景识别中有效性的影响。
  • 评估最先进模型是否能在比通常假设更早的时间实现可靠识别,基于真实世界音频的变异性。

提出的方法

  • 采用两种单网络模型:一种基于2D卷积滤波器的CNN,其在时间维度和输入特征通道上同时操作;另一种基于先前最先进架构的RNN。
  • 使用从三种低层次音频特征(Gammatone谱系数、MFCC和对数Bark滤波器组)提取的标签树嵌入(LTE)特征,并将其投影到分层概率空间中。
  • 通过在分类前拼接CNN与RNN特征实现早期融合,通过使用求和、最大值和乘法融合策略对预测结果进行概率聚合实现后期融合。
  • 在LITIS-Rouen数据集上训练模型,使用4秒音频片段,帧长250ms,帧重叠50%,并在4至30秒不等的测试信号长度下评估性能。
  • 使用F1-score在所有场景类别上评估分类性能,并分析平均值与类别特定的趋势。
  • 使用分层标签树编码场景类别间的关系,以实现更鲁棒的特征表示并提升泛化能力。

实验结果

研究问题

  • RQ1不同场景类别实现可靠音频场景识别所需的信号长度有何差异?
  • RQ2在何种信号长度下,模型融合(早期或后期)在音频场景分类中带来最显著的性能提升?
  • RQ3随着信号长度增加,模型融合的优势是否减弱?如果是,原因是什么?
  • RQ4最先进单模型(CNN与RNN)是否能在比通常使用的30秒标准更早的时间实现可靠识别?
  • RQ5在不同信号时长下,不同融合策略(早期融合与后期融合)的性能表现如何比较?

主要发现

  • 部分音频场景,如'aviation'('avion')、'kidgame'和'poolhall',分别在4秒、12秒和16秒内即可实现近乎完美的识别。
  • 如'cafe'、'quietstreet'、'ruepietonne'和'shop'等场景需超过30秒才能达到良好性能,表明其识别难度较高。
  • 使用乘法融合策略的后期融合表现最佳,相较于独立的CNN和RNN,平均F1-score分别提升0.4%和0.2%。
  • 早期融合始终降低性能,相较于独立的CNN和RNN,F1-score分别降低1.0%和1.2%(绝对值)。
  • 模型融合在短信号长度(<20秒)下最有益,此时其可弥补单个模型信息不足的缺陷。
  • 当信号长度超过20秒后,融合带来的性能增益趋于平缓,表明独立的RNN在长片段上已具备高度可靠性。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。