Skip to main content
QUICK REVIEW

[论文解读] To bee or not to bee: Investigating machine learning approaches for beehive sound recognition

Inês Nolasco, Emmanouil Benetos|arXiv (Cornell University)|Nov 14, 2018
Music and Audio Processing参考文献 12被引用 19
一句话总结

本文提出了一种基于支持向量机(SVM)和卷积神经网络(CNN)的机器学习方法,用于自动识别蜂箱声音,并引入了一个来自开源蜂箱项目和NU-Hive项目的新型标注数据集。主要发现表明,提供更长的时间上下文可显著提升性能,而数据平衡和针对特定蜂箱的训练对泛化能力至关重要,尽管AUC得分较低,但CNN在泛化方面略优于SVM。

ABSTRACT

In this work, we aim to explore the potential of machine learning methods to the problem of beehive sound recognition. A major contribution of this work is the creation and release of annotations for a selection of beehive recordings. By experimenting with both support vector machines and convolutional neural networks, we explore important aspects to be considered in the development of beehive sound recognition systems using machine learning approaches.

研究动机与目标

  • 开发基于机器学习的系统,用于自动检测音频记录中蜂箱声音与外部非蜜蜂声音。
  • 通过从开源蜂箱和NU-Hive项目中创建并发布一个新标注数据集,解决蜂箱声音识别中缺乏标注数据的问题。
  • 研究SVM与CNN在使用手工特征与深度学习方法时,区分蜂箱声音与环境噪声的有效性。
  • 评估数据平衡、片段大小和感受野对模型性能的影响。
  • 识别在真实养蜂应用中部署鲁棒蜂箱声音识别系统的关键设计考量。

提出的方法

  • 作者通过标注开源蜂箱和NU-Hive项目中选定的录音,创建了一个新标注数据集,重点关注纯蜂箱声音与外部非蜜蜂声音。
  • 对于基于SVM的分类,从音频片段中提取梅尔频率倒谱系数(MFCCs),并采用过采样方法进行数据平衡与不进行数据平衡的对比训练。
  • 采用一种源自原始用于鸟类声音检测的Bulbul系统的CNN方法,并针对更长时长的蜂箱声音进行了修改。
  • 通过使用不同的片段大小(S)和感受野(1000至2000帧,约14至30秒)训练CNN,以评估时间上下文对性能的影响。
  • 数据划分策略包括蜂箱依赖型(同蜂箱内)和蜂箱独立型(跨蜂箱)划分,以评估在不同蜂箱间的泛化能力。
  • 评估采用受试者工作特征曲线下面积(AUC)指标,结果通过三次随机运行的平均值以确保稳健性。

实验结果

研究问题

  • RQ1SVM与CNN在区分蜂箱声音与外部环境声音方面表现如何比较?
  • RQ2数据平衡对不平衡蜂箱声音数据集中模型性能有何影响?
  • RQ3时间上下文长度(片段大小与感受野)如何影响识别准确率?
  • RQ4在某一蜂箱上训练的模型在未见过的蜂箱上能多大程度实现泛化?
  • RQ5不同的数据划分策略(蜂箱依赖型与蜂箱独立型)如何影响模型泛化能力与过拟合?

主要发现

  • CNN模型在测试集上的平均AUC得分低于SVM,表明在此特定设置下SVM表现更优。
  • 使用更大的片段大小(S = 60秒)相比S = 30秒显著提升了CNN性能,表明更长的输入片段有助于更好地利用上下文信息。
  • 将感受野从约14秒增加到约30秒显著改善了CNN性能,证实更长的时间上下文对蜂箱声音识别有益。
  • 数据平衡显著提升了CNN性能,未平衡的训练集导致性能下降,凸显了处理类别不平衡的重要性。
  • 蜂箱独立划分方案揭示了两种模型的泛化能力均较差,表明在某一蜂箱上训练的系统在其他蜂箱上表现不佳,限制了跨蜂箱部署。
  • 当数据平衡时,SVM模型在训练与测试AUC得分之间差异极小,表明其在相同条件下比CNN更不易过拟合。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。