Skip to main content
QUICK REVIEW

[論文レビュー] Sound Event Detection of Weakly Labelled Data with CNN-Transformer and Automatic Threshold Optimization

Qiuqiang Kong, Yong Xu|View|Dec 10, 2019
Music and Audio Processing参考文献 47被引用数 5
ひとこと要約

この論文は、弱教師あり音声データにおける音声イベント検出(SED)のためのCNN-Transformerモデルを提案し、クリップ単位の学習と自動閾値最適化手法を組み合わせることで性能を向上させている。2段階のプロセスによる閾値最適化により、F1スコアが音声タギングで0.646、SEDで0.584に達し、経験的閾値選択や先行手法を上回る性能を達成した。

ABSTRACT

Sound event detection (SED) is a task to detect sound events in an audio recording. One challenge of the SED task is that many datasets such as the Detection and Classification of Acoustic Scenes and Events (DCASE) datasets are weakly labelled. That is, there are only audio tags for each audio clip without the onset and offset times of sound events. \qk{We compare segment-wise and clip-wise training for SED that is lacking in previous works. We propose a convolutional neural network transformer (CNN-Transfomer) for audio tagging and SED, and show that CNN-Transformer performs similarly to a convolutional recurrent neural network (CRNN)}. Another challenge of SED is that thresholds are required for detecting sound events. Previous works set thresholds empirically, and are not an optimal approaches. To solve this problem, we propose an automatic threshold optimization method. The first stage is to optimize the system with respect to metrics that do not depend on thresholds, such as mean average precision (mAP). The second stage is to optimize the thresholds with respect to metrics that depends on those thresholds. Our proposed automatic threshold optimization system achieves a state-of-the-art audio tagging F1 of 0.646, outperforming that without threshold optimization of 0.629, and a sound event detection F1 of 0.584, outperforming that without threshold optimization of 0.564.

研究の動機と目的

  • 弱教師ありデータにおける音声イベント検出(SED)の課題に取り組むこと。この場合、オフセット/オフセット時刻がなく、クリップ単位のラベルのみが利用可能である。
  • 弱教師ありデータの文脈において、セグメント単位の学習とクリップ単位の学習戦略を、SEDおよび音声タギング(AT)の文脈で比較すること。
  • 従来の経験的閾値選択を超えて、SEDおよびAT性能を向上させる、新たな自動閾値最適化手法を開発すること。
  • CRNNと比較して、CNN-Transformerアーキテクチャが長距離時系列依存性をどのように捉えられるかを評価すること。
  • 弱教師付きSEDおよびATの分野で、DCASE 2017タスク4データセットにおいて最先端の性能を達成すること。

提案手法

  • 畳み込み特徴抽出と自己注意機構を組み合わせたCNN-Transformerアーキテクチャを提案し、音声スペクトログラム内の長距離時系列依存性をモデル化する。
  • クリップ単位の学習を採用し、セグメントに分割せず、全体の音声クリップを入力として使用することで、グローバルなコンテキストを保持する。
  • 2段階の自動閾値最適化を導入:まずmAPなどの閾値に依存しない指標を用いてモデルパラメータを最適化し、次にF1などの閾値に依存する指標を用いて閾値を最適化する。
  • バリデーションセットを用いて、グリッドサーチや最適化アルゴリズムにより閾値を調整し、バリデーション分割でF1スコアを最大化する閾値を選択した後、評価セットでテストを実施する。
  • 最終層の出力にシグモイド活性化関数を適用し、クラスごとの確率スコアを取得し、その後、イベントの有無を予測するために閾値処理を行う。
  • 音声タギング(AT)およびSEDの両タスクにおいて、標準指標(mAP、F1スコア、ER)を用いて性能を評価する。

実験結果

リサーチクエスチョン

  • RQ1弱教師ありSEDおよび音声タギングにおいて、クリップ単位の学習はセグメント単位の学習と比べて、性能にどのように影響するか?
  • RQ2CNN-Transformerモデルは、CRNNと同等の性能を達成しつつ、並列計算を可能にするか?
  • RQ3自動閾値最適化は、固定された経験的閾値と比較して、音声タギングおよび音声イベント検出におけるF1スコアを顕著に向上させるか?
  • RQ4どの音声クラスが最も・最も検出されやすく、閾値最適化はそれらの性能にどのように影響するか?
  • RQ5提案手法は、弱教師ありSEDのDCASE 2017タスク4ベンチマークで最先端の結果を達成できるか?

主な発見

  • 音声タギングタスクにおいて、CNN-Transformerモデルは評価セットでF1スコア0.646を達成し、閾値最適化を行わないベースライン(0.629)を上回った。
  • 自動閾値最適化を施したSEDシステムは、F1スコア0.584を達成し、最適化を行わないバージョン(0.564)を上回った。
  • 自動閾値最適化により、評価セットにおける誤差率(ER)は0.78から0.68に低下し、SED性能の顕著な向上が示された。
  • クリップ単位の学習戦略は、音声タギングでmAP 0.650、SEDでER 0.68を達成し、DCASE 2017データセットにおいて強力な性能を示した。
  • CNN-TransformerはCRNNベースのモデルと同等の性能を示したが、並列計算が可能であり、計算上の利点を有する。
  • 提案手法は、DCASE 2017タスク4ベンチマークで最先端の性能を達成し、アンサンブルシステムを含む先行手法を上回った。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。