Skip to main content
QUICK REVIEW

[論文レビュー] Cost-sensitive detection with variational autoencoders for environmental acoustic sensing

Yunpeng Li, Ivan Kiskin|arXiv (Cornell University)|Dec 7, 2017
Music and Audio Processing参考文献 21被引用数 5
ひとこと要約

本稿では、変分オートエンコーダー(VAEs)とアンサンブル選択を用いたコスト感受性検出フレームワークを提案し、環境音響センシングにおいて誤検出率をユーザーが定めたしきい値未満に制約するとともに、誤検出数を最小限に抑える。ネイマン=ピアソン基準を用いてVAEアーキテクチャとSVMハイパーパrameterを同時に最適化することで、誤検出率を制御可能なまま、低消費電力の組み込みシステムにおけるモスキートの検出を信頼性高く実現する。

ABSTRACT

Environmental acoustic sensing involves the retrieval and processing of audio signals to better understand our surroundings. While large-scale acoustic data make manual analysis infeasible, they provide a suitable playground for machine learning approaches. Most existing machine learning techniques developed for environmental acoustic sensing do not provide flexible control of the trade-off between the false positive rate and the false negative rate. This paper presents a cost-sensitive classification paradigm, in which the hyper-parameters of classifiers and the structure of variational autoencoders are selected in a principled Neyman-Pearson framework. We examine the performance of the proposed approach using a dataset from the HumBug project which aims to detect the presence of mosquitoes using sound collected by simple embedded devices.

研究の動機と目的

  • 環境音響センシングにおける誤検出率と誤検出数の原理的制御の欠如に対処すること。
  • 誤検出数を最小化するとともに、指定されたしきい値未満に誤検出率を制約する手法を開発すること。
  • 変分オートエンコーダーを用いた特徴次元削減により、低消費電力の組み込みデバイスへの効率的で展開を可能とすること。
  • データ駆動的かつ原理的な方法で、最適なVAEアーキテクチャと分類器ハイパーパrameterを特定すること。
  • ヒュームバグプロジェクトの実世界の音声データを用いて、マラリア媒介モスキートの検出を評価すること。

提案手法

  • フレームワークは、生のMFCC特徴量から低次元の潜在表現を学習するための変分オートエンコーダー(VAE)を用い、検出に必要な情報を保持しつつ次元削減を実現する。
  • VAEは、教師なし学習により、ラベルなしの環境音声データを用いて変分下界目的関数に基づいて学習される。
  • 広範な値の範囲で、複数のVAEアーキテクチャ(3および5次元の潜在空間、10および50個の隠れユニット)とSVMハイパーパrameter(γおよびν値)を組み合わせた、多数のベースモデルからなるライブラリを構築する。
  • アンサンブル選択法により、ネイマン=ピアソン指標に基づいて、誤検出率と誤検出数のトレードオフを最適化する上位100のモデルをライブラリから選択する。
  • 最終的な分類器は、選択された100のモデルからなる委員会による多数決を用い、確率的出力と、目標誤検出率を満たすように調整されたしきい値を用いて検出意思決定を行う。
  • モデル選択パイプライン全体は、バランスの取れた14,720個の音声クリップ(正例7,360個、負例7,360個)の10%を訓練用、90%をテスト用に分割したデータセットを用いて訓練および検証される。

実験結果

リサーチクエスチョン

  • RQ1コスト感受性学習フレームワークは、ユーザーが指定したしきい値未満に誤検出率を制御しながら、環境音響センシングにおける誤検出数を効果的に最小化できるか?
  • RQ2変分オートエンコーダーの統合は、音響検出タスクにおける低消費電力組み込みデプロイメントに適した特徴表現をどのように改善するか?
  • RQ3大規模なモデルライブラリからのアンサンブル選択は、標準的手法を上回るVAEアーキテクチャと分類器ハイパーパrameterの最適な組み合わせを特定できるか?
  • RQ4VAEベースの特徴再表現は、実世界のモスキート検出シナリオにおける検出性能とモデル効率にどのような影響を与えるか?
  • RQ5提案手法は、複数のランダムなデータパーティションおよび初期化シードに対して、どの程度のロバストネスを示すか?

主な発見

  • コスト感受性SVM(CSSVM)フレームワークは、100回のシミュレーション試行すべてで誤検出率が0.1の目標しきい値未満に維持された。
  • MFCC特徴量のみを用いた標準SVMは、誤検出率を0.1未満に制御できず、コスト感受性フレームワークの必要性を示した。
  • VAEベースの特徴再表現により、次元削減が実現され、組み込みデプロイメントに適したよりコンactなモデルが可能になったが、感度はわずかに低下した。
  • アンサンブル選択法により、数千ものモデルからなるライブラリの中から、誤りタイプの最適なトレードオフを達成する100の高性能モデルの委員会が特定された。
  • VAEベースの特徴学習によりモデルの複雑さが顕著に低減され、リソース制限のあるデバイスへのデプロイメントを支援した。
  • 複数のランダムなデータパーティションおよび初期化シードに対して、誤検出率制約の維持が一貫して実現され、本手法のロバストネスが示された。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。