[論文レビュー] Training sound event detection with soft labels from crowdsourced annotations
本稿では、アノテーターの不確実性と合意を表現するクラウドソーシングによるアノテーションから導出されたソフトラベルを用いて、音声イベント検出(SED)システムを訓練する手法を提案する。これらのソフトラベルは、複数のアノテーターの意見を能力重み付き集約によって計算される。モデルは、標準的なハードラベル訓練では見過ごされがちな未発生クラスの検出を学習し、クラス固有のしきい値設定によりレアイベントの検出性能が向上する。特に、平均二乗誤差(MSE)損失とソフトラベル監視を用いることで最高の性能を達成した。
In this paper, we study the use of soft labels to train a system for sound event detection (SED). Soft labels can result from annotations which account for human uncertainty about categories, or emerge as a natural representation of multiple opinions in annotation. Converting annotations to hard labels results in unambiguous categories for training, at the cost of losing the details about the labels distribution. This work investigates how soft labels can be used, and what benefits they bring in training a SED system. The results show that the system is capable of learning information about the activity of the sounds which is reflected in the soft labels and is able to detect sounds that are missed in the typical binary target training setup. We also release a new dataset produced through crowdsourcing, containing temporally strong labels for sound events in real-life recordings, with both soft and hard labels.
研究の動機と目的
- 長時間にわたる大規模で強ラベル付きのSEDデータセットの不足に応じ、時間的強ラベルを備えた新しいデータセットの構築を目的とする。
- アノテーターの不確実性と合意を反映するソフトラベルが、従来のハードラベルと比較してSEDモデルの性能を向上させるかどうかを調査すること。
- ソフトラベルを用いた場合の異なる訓練目的(BCE対 MSE)の有効性を評価すること。
- ソフトラベル監視により、標準的なハードラベル訓練では無視されがちな未発生クラスの検出が可能かどうかを実証すること。
- ソフトラベル分布とモデル出力をよりよく一致させるために、クラス固有のしきい値戦略を検討すること。
提案手法
- 重複する弱ラベル付きセグメントを用いてクラウドソーシングによるアノテーションを収集し、アノテーターが事前に定義された音声イベントの有無を示した。
- 複数のアノテーターの意見をMACEで推定された能力に基づく重み付き集約により統合し、0〜1の間の活動スコアであるソフトラベルを計算した。
- 5つの実生の音響シーン、17種類の音声クラスを含み、ソフトラベルとハードラベルの両方を備えた新しいデータセットMAESTRO-Realを公開した。
- SEDモデルは、ソフトラベルを用いてバイナリクロスエントロピー(BCE)および平均二乗誤差(MSE)損失関数で訓練した。
- システムの出力を、ハードラベルに対する1秒セグメントベースのF1スコアと誤り率(ER)、およびソフトラベルに対するKullback-Leibler発散(KLD)で評価した。
- 稀なイベントの検出感度を最適化するために、各クラスごとに10%トリムドミッドレンジのしきい値を用いてクラスワイドな性能を分析した。
実験結果
リサーチクエスチョン
- RQ1クラウドソーシングによるアノテーションから導出されたソフトラベルは、ハードラベルと比較して音声イベント検出性能を向上させることができるか?
- RQ2ソフトラベルで訓練することで、標準的なハードラベル訓練では見過ごされがちな未発生クラスの検出が可能になるか?
- RQ3異なる損失関数(BCE 対 MSE)は、ソフトラベル監視とどのように作用するか?
- RQ4ソフト予測とソフトリファレンス間のKLDは、モデルのキャリブレーションと不確実性モデリングをどの程度反映しているか?
- RQ5ソフトラベル監視を用いる場合、クラス固有のしきい値戦略は、稀なイベントの検出を向上させることができるか?
主な発見
- ソフトラベルとMSE損失で訓練したS_MSE_linモデルは、最も高いマイクロ平均F1スコア(70.82%)と、ソフトリファレンスとの最小KLD(1.383)を達成し、ソフトラベル分布との整合性が最も高かった。
- ハードラベルとBCE損失で訓練したH_BCE_sigモデルは、訓練目的におけるクラス不均衡のため、未発生クラスを検出できなかった。
- MSE損失を用いたソフトラベル訓練により、ソフトラベル値が0.5未満であっても、すべての音声クラスの検出が可能になった。固定の0.5しきい値を適用した場合、これらのクラスは消失していた。
- ソフトラベルの10%トリムドミッドレンジに基づくクラス依存のしきい値を用いることで、クラスワイドF1スコアが著しく向上した。全体のER(0.47)とF1(67.30%)は、最高性能を示したハードラベルモデルよりわずかに悪化したが、稀なイベントの検出感度が向上した。
- KLD指標により、S_MSE_linモデルのソフト出力がリファレンスのソフトラベルに最も近いことが確認され、効果的な不確実性モデリングが実現した。
- ソフトラベルとハードラベルの両方を備えたMAESTRO-Realデータセットの公開により、将来的な不確実性を考慮したSED研究のための貴重なベンチマークが提供された。
より良い研究を、今すぐ始めましょう
論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。
クレジットカード登録不要
このレビューはAIが作成し、人間の編集者が確認しました。