Skip to main content
QUICK REVIEW

[論文レビュー] On Multitask Loss Function for Audio Event Detection and Localization

Huy Phan, Lam Pham|arXiv (Cornell University)|Sep 11, 2020
Music and Audio Processing参考文献 16被引用数 16
ひとこと要約

本稿では、マルチタスク音声イベント検出および局在化(SELD)のための同種の平均二乗誤差(MSE)損失を提案する。イベント検出とアレイアングル推定の両方を回帰問題として定式化する。DCASE 2020における実験では、ベースラインと比較して組み合わせた SELD 誤差が10%絶対値で低減され、すべての指標において収束性と性能が向上した。

ABSTRACT

Audio event localization and detection (SELD) have been commonly tackled using multitask models. Such a model usually consists of a multi-label event classification branch with sigmoid cross-entropy loss for event activity detection and a regression branch with mean squared error loss for direction-of-arrival estimation. In this work, we propose a multitask regression model, in which both (multi-label) event detection and localization are formulated as regression problems and use the mean squared error loss homogeneously for model training. We show that the common combination of heterogeneous loss functions causes the network to underfit the data whereas the homogeneous mean squared error loss leads to better convergence and performance. Experiments on the development and validation sets of the DCASE 2020 SELD task demonstrate that the proposed system also outperforms the DCASE 2020 SELD baseline across all the detection and localization metrics, reducing the overall SELD error (the combined metric) by approximately 10% absolute.

研究の動機と目的

  • 異種の損失関数を用いたマルチタスク音声イベント検出および局在化(SELD)における過小適合問題に対処すること。
  • 統一された損失関数が、共同SELDモデリングにおける学習収束性とモデル一般化性能を向上させるかを調査すること。
  • 検出および局在化サブタスクの両方でMSE損失のみを用いたマルチタスク回帰モデルの性能を評価すること。
  • 本手法を、シグモイド交差エントロピー(CE)と平均二乗誤差(MSE)損失の組み合わせを用いるDCASE 2020ベースラインと比較すること。
  • 統一されたMSEベースのアプローチが、検出および局在化の両方の指標においてよりバランスの取れた改善性能をもたらすことを示すこと。

提案手法

  • 音声イベント検出(SED)とアレイアングル推定(DOA)を両方とも回帰タスクとして定式化し、分類ベースのシグモイド交差エントロピー損失の必要性を排除する。
  • 両サブタスクに同一の平均二乗誤差(MSE)損失関数を用い、学習中の同種の最適化を保証する。
  • 時間周波数表現内の時間的および文脈的依存関係をモデル化するため、双方向GRUと自己注意機構を備えたCRNNアーキテクチャを実装する。
  • サイズ $ T \times F \times C $ の入力スペクトログラムを、バッチ正則化とReLU活性化関数を伴う6層の畳み込み層を経て処理し、最大プーリングを適用して空間次元を低減する。
  • 最初の畳み込みブロックの後に5×2の最大プーリング層を適用し、時間次元を100msの評価フレーム解像度に一致させる。
  • GRUで符号化された系列に対して自己注意を適用し、各時間フレーム周辺の文脈モデリングを強化する。

実験結果

リサーチクエスチョン

  • RQ1分類用のシグモイド交差エントロピー(CE)と回帰用のMSEの異種損失関数を組み合わせることで、共同学習中にSEDサブタスクに過小適合が生じるか?
  • RQ2SEDおよびDOA推定の両方に対して同種のMSE損失を用いることで、混合損失戦略と比較してモデルの収束性と性能が向上するか?
  • RQ3提案手法のマルチタスク回帰モデルは、DCASE 2020ベースラインと比較して検出および局在化の正確性においてどのように異なるか?
  • RQ4損失重みの不均衡が、共同SELDモデルの最適化ダイナミクスに与える影響は何か?
  • RQ5回帰ベースの損失関数のみを用いることで、検出および局在化の両方の指標においてより良い一般化性能とバランスの取れた性能が達成されるか?

主な発見

  • SEDおよびDOA推定の両方に対して同種のMSE損失を用いることで、標準的なCE+MSE組み合わせと比較して著しく収束性が向上し、過小適合が低減された。
  • 提案モデルは、開発セットおよび評価セットの両方でDCASE 2020ベースラインと比較して、全体のSELD誤差を約10%絶対値で低減した。
  • 開発セットでは、SELD誤差がFOAで0.08、MICで0.11の絶対値でベースラインを下回った。
  • 評価セットでは、誤差低減がFOAで0.11、MICで0.09の絶対値に達し、一貫した改善が確認された。
  • 同種のMSE損失下ではSEDサブタスクの性能が著しく向上した一方、DOA推定性能はベースラインと同等の水準を維持した。
  • 本モデルは、アンサンブルや複数マイクロホンアレイに依存しないコンactなモデルでありながら、DCASE 2020タスク3コンテストで6位の順位を達成した。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。