Skip to main content
QUICK REVIEW

[論文レビュー] The Orchive : Data mining a massive bioacoustic archive

Steven R. Ness, Helena Symonds|arXiv (Cornell University)|Jul 2, 2013
Music and Audio Processing参考文献 6被引用数 7
ひとこと要約

The Orchive は、1980 年以降に収集された 20,000 時間を超えるオキアラの生体音声アーカイブを、機械学習を用いて背景ノイズ、オキアラの鳴き声、研究者による音声メモに分類するウェブベースのプラットフォームです。MFCC およびスペクトル特徴を用いた SVM を用いることで、オキアラの鳴き声を 93.4% の正確度で分類し、6 種類の鳴き声を 98.5% の正確度で区別しています。これにより、大規模な生体音声データに対するスケーラブルで共同可能な研究が可能になります。

ABSTRACT

The Orchive is a large collection of over 20,000 hours of audio recordings from the OrcaLab research facility located off the northern tip of Vancouver Island. It contains recorded orca vocalizations from the 1980 to the present time and is one of the largest resources of bioacoustic data in the world. We have developed a web-based interface that allows researchers to listen to these recordings, view waveform and spectral representations of the audio, label clips with annotations, and view the results of machine learning classifiers based on automatic audio features extraction. In this paper we describe such classifiers that discriminate between background noise, orca calls, and the voice notes that are present in most of the tapes. Furthermore we show classification results for individual calls based on a previously existing orca call catalog. We have also experimentally investigated the scalability of classifiers over the entire Orchive.

研究の動機と目的

  • 1980 年以降に収集された 20,000 時間を超えるオキアラの生体音声アーカイブを、大規模かつ共同で分析することを可能にする。
  • 膨大な音声アーカイブの手作業によるアノテーションの課題に対処するため、自動化された機械学習分類器を開発する。
  • 最適化された音声特徴抽出と SVM ベースのモデルを用いて分類の正確度を向上させる。
  • PBS および Westgrid を用いた分散コンピューティングにより、アーカイブ全体にわたる分類器のスケーラビリティとパフォーマンスを支援する。

提案手法

  • システムは、研究者が波形およびスペクトル表現を用いて音声クリップを聴取・可視化・アノテートできるウェブインターフェースを提供する。
  • MFCC、コアセンター、ロールオフ周波数、フラックス、ゼロクロス率といった音声特徴が Marsyas フレームワークを用いて抽出される。
  • 手作業でクリッピングされた音声クリップを用いて、順次最小最適化(SMO)SVM 分類器を訓練し、背景ノイズ、オキアラの鳴き声、音声メモの区別を実施する。
  • PBS および Westgrid を用いた分散コンピューティングにより、クラスタ上でアーカイブ全体の分類が実行され、データサブセットごとにパフォーマンスが測定される。
  • 分類の正確度を最大化するために、600 秒のラベル付きデータセットを用いて、特徴抽出パラメータ(窓サイズ、ホップサイズ、メモリ)が最適化される。
  • 鳴き声分類には、20ms フレームごとの特徴量の平均値および標準偏差が用いられ、6 種類のカテゴリ(例:N1、N4、N7、N9、N47)からなる 197 個のラベル付き鳴き声で訓練される。

実験結果

リサーチクエスチョン

  • RQ1大規模なアーカイブにおいて、オキアラの鳴き声を分類するための音声特徴抽出パラメータ(窓サイズ、ホップサイズ、メモリ)の最適な設定は何か?
  • RQ2実世界の録音において、機械学習分類器は背景ノイズ、オキアラの鳴き声、研究者による音声メモをどれほど効果的に区別できるか?
  • RQ3抽出された音声特徴を用いて、トレーニング済みの SVM 分類器は、キュレートされたカタログから個々のオキアラの鳴き声タイプを正確に特定できるか?
  • RQ4分散コンピューティングを用いて 20,000 時間を超える Orchive 全体に分類器を適用した場合、パフォーマンスはどのようにスケーリングするか?
  • RQ5静音部分を除去するために音声クリップを手作業でトリミングすることは、分類の正確度にどのような影響を与えるか?

主な発見

  • 最適な音声特徴抽出パラメータは、40ms の窓サイズ、1024 のホップサイズ、512ms のメモリであり、600 秒のテストセットで 80.58% の正確度を達成した。
  • 手作業でクリッピングされたクリップを訓練データに用いることで、分類器の正確度が約 90% から 96.5% に向上し、事前処理の価値が示された。
  • SVM 分類器は、アーカイブ全体の録音を背景、オキアラ、音声の 3 カテゴリに分類する際、93.4% の正確度を達成した。
  • 197 個のラベル付き鳴き声を用いた鳴き声分類では 98.5% の正確度を達成し、特に N7 および N9 の鳴き声が最も頻繁に誤分類された。
  • スケーリングのパフォーマンスはほぼ線形のスピードアップを示した:10 台のコンピュータでアーカイブ全体(100%)の分類に 2:04:18:32 が要し、データの 1% ではわずか 5 分で完了した。
  • 誤分類マトリクスは、N1 および N9 鳴き声に対して高い正確度を示したが、N7 および N9 はより高い誤分類率を示しており、人間がこれらを区別するのが難しいことと整合的であった。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。