Skip to main content
QUICK REVIEW

[论文解读] Cost-sensitive detection with variational autoencoders for environmental acoustic sensing

Yunpeng Li, Ivan Kiskin|arXiv (Cornell University)|Dec 7, 2017
Music and Audio Processing参考文献 21被引用 5
一句话总结

本文提出一种基于变分自编码器(VAEs)和集成选择的代价敏感检测框架,用于环境声学传感,在将假阳性率控制在用户定义阈值以下的同时最小化假阴性。通过联合优化VAE架构与SVM超参数(基于Neyman-Pearson准则),该方法在低功耗嵌入式系统中实现了可控误差率的可靠蚊子检测。

ABSTRACT

Environmental acoustic sensing involves the retrieval and processing of audio signals to better understand our surroundings. While large-scale acoustic data make manual analysis infeasible, they provide a suitable playground for machine learning approaches. Most existing machine learning techniques developed for environmental acoustic sensing do not provide flexible control of the trade-off between the false positive rate and the false negative rate. This paper presents a cost-sensitive classification paradigm, in which the hyper-parameters of classifiers and the structure of variational autoencoders are selected in a principled Neyman-Pearson framework. We examine the performance of the proposed approach using a dataset from the HumBug project which aims to detect the presence of mosquitoes using sound collected by simple embedded devices.

研究动机与目标

  • 解决环境声学传感中对假阳性与假阴性率缺乏系统控制的问题。
  • 开发一种方法,在将假阳性率控制在指定阈值以下的同时最小化假阴性率。
  • 通过使用变分自编码器进行特征维度压缩,实现在低功耗嵌入式设备上的高效部署。
  • 以系统化、数据驱动的方式选择最优的VAE架构与分类器超参数。
  • 在HumBug项目的真实音频数据上评估该框架在疟疾媒介蚊子检测中的性能。

提出的方法

  • 该框架使用变分自编码器(VAE)从原始MFCC特征中学习低维潜在表示,降低维度的同时保留与检测相关的信息。
  • VAE在无标签的环境音频数据上以无监督方式训练,使用变分下界目标函数。
  • 通过在广泛取值范围内组合多种VAE架构(3和5个潜在维度,10和50个隐藏单元)与SVM超参数(γ和ν值),构建了一个大规模基模型库。
  • 集成选择方法从该库中基于Neyman-Pearson度量选出前100个模型,以优化假阳性与假阴性率之间的权衡。
  • 最终分类器使用所选100个模型组成的委员会进行多数投票决策,检测结果基于概率输出,并通过阈值调优以满足目标假阳性率。
  • 整个模型选择流程使用10%训练/90%测试的划分方式,在一个包含14,720段音频片段(7,360个正样本,7,360个负样本)的平衡数据集上进行训练与验证。

实验结果

研究问题

  • RQ1代价敏感学习框架能否在环境声学传感中有效将假阳性率控制在用户指定阈值以下,同时最小化假阴性?
  • RQ2变分自编码器的集成如何提升特征表示,以支持低功耗嵌入式设备上的声学检测任务?
  • RQ3从大规模模型库中通过集成选择能否识别出最优的VAE架构与分类器超参数组合,使其优于标准方法?
  • RQ4基于VAE的特征重表示对真实世界蚊子检测场景中的检测性能与模型效率有何影响?
  • RQ5所提出方法在多个随机数据划分与初始化种子下,其鲁棒性如何?

主要发现

  • 代价敏感SVM(CSSVM)框架在全部100次模拟试验中均成功将假阳性率控制在目标阈值0.1以下。
  • 仅使用MFCC特征的标准SVM无法将假阳性率控制在0.1以下,证明了代价敏感框架的必要性。
  • 基于VAE的特征重表示降低了特征维度,使模型更紧凑,更适合嵌入式部署,尽管灵敏度略有下降。
  • 集成选择方法从数千个模型的库中识别出一个由100个高性能模型组成的委员会,实现了两类错误之间的最优权衡。
  • 所提出的框架通过基于VAE的特征学习显著降低了模型复杂度,支持在资源受限设备上的部署。
  • 该方法在多个随机数据划分与初始化种子下表现出鲁棒性,假阳性率约束保持一致且稳定。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。