Skip to main content
QUICK REVIEW

[论文解读] The Orchive : Data mining a massive bioacoustic archive

Steven R. Ness, Helena Symonds|arXiv (Cornell University)|Jul 2, 2013
Music and Audio Processing参考文献 6被引用 7
一句话总结

The Orchive 是一个基于网络的平台,用于挖掘自1980年以来收集的超过20,000小时的虎鲸生物声学档案,利用机器学习将音频分类为背景噪声、虎鲸叫声和研究人员的语音笔记。该平台使用MFCC和频谱特征的SVM模型,对虎鲸叫声的分类准确率达到93.4%;对六种叫声类型的区分准确率达到98.5%,实现了大规模生物声学数据的可扩展、协作式研究。

ABSTRACT

The Orchive is a large collection of over 20,000 hours of audio recordings from the OrcaLab research facility located off the northern tip of Vancouver Island. It contains recorded orca vocalizations from the 1980 to the present time and is one of the largest resources of bioacoustic data in the world. We have developed a web-based interface that allows researchers to listen to these recordings, view waveform and spectral representations of the audio, label clips with annotations, and view the results of machine learning classifiers based on automatic audio features extraction. In this paper we describe such classifiers that discriminate between background noise, orca calls, and the voice notes that are present in most of the tapes. Furthermore we show classification results for individual calls based on a previously existing orca call catalog. We have also experimentally investigated the scalability of classifiers over the entire Orchive.

研究动机与目标

  • 实现对自1980年以来收集的超过20,000小时虎鲸叫声生物声学档案的大规模、协作式分析。
  • 通过开发自动化的机器学习分类器,解决大规模音频档案手动标注的挑战。
  • 通过优化音频特征提取和基于SVM的模型,提高分类准确率。
  • 利用分布式计算,支持在整个档案中对分类器的可扩展性和性能。

提出的方法

  • 该系统使用基于网络的界面,供研究人员收听、可视化并标注音频片段,包含波形和频谱图表示。
  • 使用Marsyas框架提取包括MFCC、质心、频谱rolloff、频 flux 和零交叉在内的音频特征。
  • 基于人工修剪的音频片段,使用序列最小优化(SMO)SVM分类器进行训练,以区分背景噪声、虎鲸叫声和语音笔记。
  • 通过PBS和Westgrid实现的分布式计算,使整个Orchive在集群上完成分类,性能在数据子集上进行测量。
  • 使用600秒的标注数据集优化特征提取参数(窗口大小、步长、记忆长度),以最大化分类准确率。
  • 叫声分类基于20ms帧的特征均值和标准差,使用来自六个类别的197个标注叫声(例如,N1、N4、N7、N9、N47)进行训练。

实验结果

研究问题

  • RQ1在大型档案中对虎鲸叫声进行分类时,音频特征提取参数(窗口大小、步长、记忆长度)的最佳配置是什么?
  • RQ2机器学习分类器在真实录音中区分背景噪声、虎鲸叫声和研究人员语音笔记的效果如何?
  • RQ3经过训练的SVM分类器能否利用提取的音频特征,准确识别来自精心整理目录的个体虎鲸叫声类型?
  • RQ4当使用分布式计算将分类器应用于完整的20,000+小时Orchive时,其性能如何扩展?
  • RQ5将音频片段手动修剪以去除静音,对分类准确率有何影响?

主要发现

  • 最优音频特征提取参数为40ms窗口大小、1024步长和512ms记忆长度,在600秒测试集上达到80.58%的准确率。
  • 当使用人工修剪的片段进行训练时,分类器准确率从约90%提升至96.5%,证明了预处理的价值。
  • SVM分类器在完整Orchive录音中对背景、虎鲸和语音三类的分类准确率达到93.4%。
  • 基于197个标注叫声的叫声分类准确率达98.5%,其中N7和N9叫声被误分类的频率最高。
  • 性能扩展显示近似线性加速:在10台计算机上分类完整Orchive耗时2:04:18:32,而仅1%的数据仅需5分钟。
  • 混淆矩阵显示N1和N9叫声的精确度较高,而N7和N9的误分类率较高,与人类区分这些叫声的困难程度一致。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。