Skip to main content
QUICK REVIEW

[论文解读] Histogram of gradients of Time-Frequency Representations for Audio scene detection

Alain Rakotomamonjy, Gilles Gasso|arXiv (Cornell University)|Aug 20, 2015
Music and Audio Processing参考文献 1被引用 7
一句话总结

本文提出了一种基于梯度直方图(HOG)的新颖音频场景分类特征,该特征应用于时间-频率表示(TFRs),特别采用恒定-Q变换(CQT)。通过捕捉局部谱功率变化方向(如交通场景中的啁啾样调制),该方法在新提出的19类数据集(约1500分钟音频)上实现了0.917的平均平均精度(mAP),优于MFCC及其他最先进特征。

ABSTRACT

This paper addresses the problem of audio scenes classification and contributes to the state of the art by proposing a novel feature. We build this feature by considering histogram of gradients (HOG) of time-frequency representation of an audio scene. Contrarily to classical audio features like MFCC, we make the hypothesis that histogram of gradients are able to encode some relevant informations in a time-frequency {representation:} namely, the local direction of variation (in time and frequency) of the signal spectral power. In addition, in order to gain more invariance and robustness, histogram of gradients are locally pooled. We have evaluated the relevance of {the novel feature} by comparing its performances with state-of-the-art competitors, on several datasets, including a novel one that we provide, as part of our contribution. This dataset, that we make publicly available, involves $19$ classes and contains about $900$ minutes of audio scene recording. We thus believe that it may be the next standard dataset for evaluating audio scene classification algorithms. Our comparison results clearly show that our HOG-based features outperform its competitors

研究动机与目标

  • 通过提出一种能捕捉时间-频率表示中谱功率变化方向的新特征,解决音频场景分类的挑战。
  • 克服传统特征(如MFCC)的局限性,后者仅编码谱包络,而无法捕捉啁啾或加速度等动态谱变化。
  • 通过从CQT表示中提取的HOG特征进行局部池化,构建一种鲁棒且不变的特征。
  • 提供一个新公开可用的音频场景数据集,包含19个类别和约1500分钟录音,作为未来研究的基准。
  • 在多个数据集(包括新数据集)上展示HOG-TFR特征相对于现有特征的优越性,以验证其最先进性能。

提出的方法

  • 将恒定-Q变换(CQT)应用于音频信号,生成时间-频率表示(TFRs),以保持对数频率分辨率。
  • 在CQT幅值谱图上计算梯度直方图(HOG),以编码时间与频率上谱功率的局部方向变化。
  • 使用8个bin的有符号和无符号梯度方向,并在2×2单元上应用空间池化,以增强不变性与鲁棒性。
  • 不对HOG直方图进行归一化,并对时间维度进行完全池化,以保留全局结构,提升判别能力。
  • 使用支持向量机(SVM)基于HOG-TFR特征进行分类,通过20次随机训练/测试划分进行评估。
  • 使用一个新颖且公开发布的数据集,包含19个类别和约1500分钟音频录音,用于性能评估并确保可复现性。

实验结果

研究问题

  • RQ1时间-频率表示的梯度直方图(HOG)能否捕捉MFCC无法编码的判别性动态谱模式(如交通场景中的啁啾)?
  • RQ2在真实世界音频场景数据集上,所提出的HOG-TFR特征与MFCC及其他最先进特征相比,分类准确率如何?
  • RQ3HOG特征的局部空间池化在多大程度上提升了音频场景分类中的鲁棒性与不变性?
  • RQ4所提出的HOG-TFR特征能否在多样化音频场景中良好泛化,包括具有相似声学内容的场景(如行人街道与火车站大厅)?
  • RQ5新发布的、包含19个类别和约1500分钟音频的公开数据集是否可作为未来音频场景分类研究的可靠基准?

主要发现

  • 在新19类数据集的20次随机训练/测试划分中,所提出的HOG-TFR特征实现了0.9170的平均平均精度(mAP)。
  • 归一化混淆矩阵显示,交通类(公交车、小汽车、火车、高速列车、飞机)被精确识别,各项精度均超过97%。
  • 语音类和短时事件类(如儿童游戏厅、台球厅)也得到良好分类,精度超过96%,归因于HOG捕捉到的显著高频瞬态特征。
  • 涉及行人行走的类别(如行人街道、火车站大厅、市场)常被混淆,表明在捕捉人群密度或运动模式的细微差异方面存在局限。
  • HOG-TFR特征优于MFCC及其他基线特征,证明其能有效编码啁啾等方向性谱动态,这对区分交通场景至关重要。
  • 研究证实,HOG-TFR特别擅长捕捉局部谱功率变化,如加速车辆引起的谱变化,而这些特征在MFCC中表现不佳。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。