Skip to main content
QUICK REVIEW

[論文レビュー] A General Network Architecture for Sound Event Localization and Detection Using Transfer Learning and Recurrent Neural Network

Thi Ngoc Tho Nguyen, Ngoc Khanh Nguyen|arXiv (Cornell University)|Nov 16, 2020
Music and Audio Processing参考文献 19被引用数 6
ひとこと要約

本論文は、音声イベント検出(SED)と到来方向(DOA)推定を別々の事前学習済みサブネットワークに分離し、その後に軽量な再帰ニューラルネットワーク(RNN)を用いて出力を整合・統合する、モジュラーかつ転移学習を活用可能なネットワークアーキテクチャを提案する。この手法は、異なる音声フォーマットおよびSED/DOAアルゴリズムにおいてDCASE 2020 SELDデータセットで競争力ある性能を達成し、独立したモデル最適化と結合学習の複雑さの低減を通じて、より高いロバスト性と実用性を示している。

ABSTRACT

Polyphonic sound event detection and localization (SELD) task is challenging because it is difficult to jointly optimize sound event detection (SED) and direction-of-arrival (DOA) estimation in the same network. We propose a general network architecture for SELD in which the SELD network comprises sub-networks that are pretrained to solve SED and DOA estimation independently, and a recurrent layer that combines the SED and DOA estimation outputs into SELD outputs. The recurrent layer does the alignment between the sound classes and DOAs of sound events while being unaware of how these outputs are produced by the upstream SED and DOA estimation algorithms. This simple network architecture is compatible with different existing SED and DOA estimation algorithms. It is highly practical since the sub-networks can be improved independently. The experimental results using the DCASE 2020 SELD dataset show that the performances of our proposed network architecture using different SED and DOA estimation algorithms and different audio formats are competitive with other state-of-the-art SELD algorithms. The source code for the proposed SELD network architecture is available at Github.

研究の動機と目的

  • ポリフォニック音声環境における音声イベント検出(SED)と到来方向(DOA)推定の同時最適化の課題に対処すること。
  • SEDとDOAネットワークのエンドツーエンド結合学習における複雑さと過学習のリスクを低減すること。
  • 既存のデータセットおよびモデルを活用して、SEDおよびDOAサブネットワークのモジュラー開発と独立した改善を可能にすること。
  • 多様なSEDおよびDOAアルゴリズムおよび音声フォーマットに対応可能な汎用的かつ実用的なSEL Dアーキテクチャの開発。
  • 転移学習と高レベル特徴の整合を活用することで、大規模な結合アノテーションデータセットへの依存を最小限に抑えること。

提案手法

  • アーキテクチャは、それぞれのタスク固有のデータセットで事前に学習済みの2つの独立したサブネットワーク(SED用およびDOA推定用)を用いる。
  • SEDサブネットワークには、AudioSetで事前学習されたモデルの重みを初期値として用いることで転移学習を適用する。
  • RNNベースの整合ネットワークが、2つのストリーム間のイベントの発生時刻、終了時刻、活性セグメントをマッチングすることで、SEDおよびDOAの出力を統合する。
  • 整合ネットワークはシーケンスレベルの出力を処理し、上流の処理の知識を得ることなく、検出された音声クラスとその対応するDOA推定値を関連付けるように学習される。
  • SEDおよびDOAの両方でマルチラベル分類フォーマットを用い、整合ネットワークにおける損失重みはSED:DOA = (0.7, 0.3) とする。
  • 本システムは、第一順位アンビソンクス(FOA)およびバイナリックマイクアレイ(mic-array)フォーマットを用いてDCASE 2020 SELDデータセットで評価された。
Fig. 1 : A general SELD network architecture.
Fig. 1 : A general SELD network architecture.

実験結果

リサーチクエスチョン

  • RQ1SEDとDOAのトレーニングを分離したモジュラーなネットワークアーキテクチャが、エンドツーエンド結合モデルと比較して競争力あるSEL D性能を達成できるか?
  • RQ2大規模な事前学習モデルからの転移学習が、限定的なSEL Dデータセットで微調整されたSEDの性能を向上させるか?
  • RQ3アーキテクチャ的・データ的結合なしに、独立して学習されたSEDおよびDOAサブネットワークの出力をRNNベースの整合ネットワークが効果的に統合できるか?
  • RQ4本アーキテクチャの性能は、異なる音声フォーマット(例:FOA対mic-array)およびSED/DOAアルゴリズムの組み合わせによってどのように変化するか?
  • RQ5既存のタスク固有のデータセットを用いた事前学習を可能にすることで、大規模な結合アノテーションデータセットへの依存を削減できるか?

主な発見

  • AudioSetからの転移学習で微調整したSED-Tモデルは、FOAフォーマットにおいてF1スコアが2.4%絶対値上昇(80.0% → 82.1%)を達成した。
  • FOAフォーマットでは、SED-TベースのSEL Dモデルが、アンサンブルベースのSMNモデルに次いで2番目に高い性能を示し、よりシンプルなアーキテクチャでも強力な性能を発揮した。
  • mic-arrayフォーマットでは、SED-TベースのSEL Dモデルが最高の性能を記録し、第1位にランクされた(このフォーマットにはベースラインモデルが存在しなかった)。
  • SSヒストグラム法を用いたDOA推定モデル(AZI-hist)は、方位角mAPスコアで最高の0.509を記録し、DOA-gcc(0.426)およびDOA-iv(0.339)を上回った。
  • DOA-ivおよびDOA-gccは単体でのDOA性能が低かったが、それらを用いた統合SEL D性能はAZI-histを用いたモデルと同等であり、整合ネットワークが劣化したDOA推定値を効果的に補正していることを示している。
  • 本アーキテクチャは、すべてのSEDおよびDOAアルゴリズムの組み合わせで競争力ある結果を達成しており、モularityおよび一般化能力の有効性を確認した。
Fig. 2 : Left: Block diagram of the SED and DOAE networks. $n_{frames}$ is the number of input frames. $n_{channels}$ and $n_{features}$ depend on types of input features. Both SED and DOAE are formulated as multi-label multi-class classification. Right: Block diagram of the alignment network. Durin
Fig. 2 : Left: Block diagram of the SED and DOAE networks. $n_{frames}$ is the number of input frames. $n_{channels}$ and $n_{features}$ depend on types of input features. Both SED and DOAE are formulated as multi-label multi-class classification. Right: Block diagram of the alignment network. Durin

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。