Skip to main content
QUICK REVIEW

[论文解读] Time-Frequency Audio Features for Speech-Music Classification

Mrinmoy Bhattacharjee, S. R. Mahadeva Prasanna|arXiv (Cornell University)|Nov 3, 2018
Music and Audio Processing被引用 4
一句话总结

本文提出了一种新颖的两阶段时频特征提取方法,用于语音-音乐分类,通过从音频帧中的显著频率峰值导出的谱峰序列(SPS)实现。将SPS视为时间序列,提取其周期性、过零率及统计特征(SPS-SCG),在四个数据集上均优于基线方法,尤其在SVM分类器上表现突出。

ABSTRACT

Distinct striation patterns are observed in the spectrograms of speech and music. This motivated us to propose three novel time-frequency features for speech-music classification. These features are extracted in two stages. First, a preset number of prominent spectral peak locations are identified from the spectra of each frame. These important peak locations obtained from each frame are used to form Spectral peak sequences (SPS) for an audio interval. In second stage, these SPS are treated as time series data of frequency locations. The proposed features are extracted as periodicity, average frequency and statistical attributes of these spectral peak sequences. Speech-music categorization is performed by learning binary classifiers on these features. We have experimented with Gaussian mixture models, support vector machine and random forest classifiers. Our proposal is validated on four datasets and benchmarked against three baseline approaches. Experimental results establish the validity of our proposal.

研究动机与目标

  • 为解决在音频分割中区分语音与音乐的挑战,通过联合利用时序-谱特征。
  • 通过特征提取框架,利用 spectrogram 中的显著条纹图案——语音呈现平滑弧线,音乐呈现水平线条。
  • 开发能捕捉显著谱峰在帧间动态演变的时频特征。
  • 在多样化音频数据集上,将所提特征与现有基线方法进行基准对比。
  • 证明从谱峰序列(SPS)中提取的统计特征与周期性特征,可显著提升分类性能。

提出的方法

  • 使用幅度谱分析,在每个音频帧中检测 p=20 个显著的谱峰。
  • 通过将这些谱峰在帧间的位置视为时间序列,构建谱峰序列(SPS)。
  • 从每个 SPS 中提取三种新特征:周期性(SPS-P)、过零率(SPS-ZCR)以及标准差、质心与梯度的组合特征(SPS-SCG)。
  • 由于性能更优,将 SPS-SCG 作为主要特征集,其结合了谱峰序列的统计特性与时间动态。
  • 使用 70:30 的训练-测试划分,对提取的特征训练并评估二分类器(GMM、SVM、随机森林)。
  • 通过网格搜索优化 SVM 超参数,并重复实验 20 次,报告平均 F1 分数及其方差。

实验结果

研究问题

  • RQ1从时频表示中提取的谱峰序列是否能超越传统谱特征与时序特征,在语音-音乐分类中取得更好性能?
  • RQ2谱峰序列的周期性与统计属性在语音与音乐信号之间有何差异?
  • RQ3所提出的 SPS-SCG 特征集是否在多样化音频环境中,优于 MFCC、Khonglah-FS 与 Sell-FS 等基线方法?
  • RQ4所提方法在包括真实广播与电影音频在内的多种数据集上是否具备鲁棒性?
  • RQ5该两阶段特征提取框架是否可推广至语音-音乐区分之外的其他音频分类任务?

主要发现

  • 在 GTZAN、Scheirer-Slaney 与 TV News Broadcast 三个数据集中,SPS-SCG 特征集在使用 SVM 分类器时表现最佳。
  • 在 Movie 数据集中,SPS-SCG 取得第二名的性能,表明其在多样化音频内容中具备优异的泛化能力。
  • 在 GTZAN 数据集上,SPS-SCG 显著优于最佳基线方法(Khonglah-FS),充分体现了其判别能力。
  • 在所有四个数据集上,所提方法均一致优于基线方法,验证了其在捕捉时频动态方面的有效性。
  • 未观察到早期或晚期特征融合带来显著增益,表明 SPS-SCG 本身已是鲁棒且充分的特征表示。
  • 将谱峰序列作为时间序列处理,能有效捕捉语音与音乐中音高与谐波结构的显著时序演化特征。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。