[論文レビュー] Boosting Active Learning for Speech Recognition with Noisy Pseudo-labeled Samples
本論文は、ラベルなしデータからのノイズあり偽ラベルを用いた一貫性正則化を組み合わせることで、エンドツーエンド音声認識におけるアクティブラーニングの性能を向上させるトレーニングパイプラインを提案する。入力の摂動に対してモデルの一貫性を保つように注意深く設計された音声拡張を適用することで、1/3のラベル付け予算下でCERが最大12.76%低減され、追加のアノテーション作業なしに標準的なアクティブラーニングを著しく上回る。
The cost of annotating transcriptions for large speech corpora becomes a bottleneck to maximally enjoy the potential capacity of deep neural network-based automatic speech recognition models. In this paper, we present a new training pipeline boosting the conventional active learning approach targeting label-efficient learning to resolve the mentioned problem. Existing active learning methods only focus on selecting a set of informative samples under a labeling budget. One step further, we suggest that the training efficiency can be further improved by utilizing the unlabeled samples, exceeding the labeling budget, by introducing sophisticatedly configured unsupervised loss complementing supervised loss effectively. We propose new unsupervised loss based on consistency regularization, and we configure appropriate augmentation techniques for utterances to adopt consistency regularization in the automatic speech recognition task. From the qualitative and quantitative experiments on the real-world dataset and under real-usage scenarios, we show that the proposed training pipeline can boost the efficacy of active learning approaches, thus successfully reducing a sustainable amount of human labeling cost.
研究の動機と目的
- 大規模な音声認識データセットにおける高い人間によるアノテーションコストを低減し、エンドツーエンドASRモデルのスケーラビリティを向上させること。
- ラベル付け予算を超えたラベルなしデータを活用することで、アクティブラーニングにおけるラベル効率を向上させること。
- ASRにおける半教師あり学習において、ノイズのある偽ラベルによる性能劣化を緩和するための頑健な正則化手法を提供すること。
- 言語的コンテンツを保持しつつモデルの耐性を高める音声拡張を設計することで、ASRにおける一貫性正則化を可能にすること。
- 実世界の多様なドメインの音声データを対象とし、実用的で低予算な設定下で提案パイプラインの有効性を検証すること。
提案手法
- ラベルなしデータからの偽ラベル(PLS)を用いた半教師あり学習とアクティブラーニング(HLS)を組み合わせたハイブリッドトレーニングパイプラインを導入する。
- 同一発話の元データと拡張済みバージョンの間で予測の一貫性を保つために、一貫性正則化(CR)を適用する。
- 発話の音声的コンテンツを保持しつつ、ASRにおける有効なCRを可能にするドメイン固有の音声拡張(例:速度変更、ノイズ注入)を設計する。
- 2段階のプロセスを採用する:まず、信頼度の高いラベルなしサンプルに対して偽ラベルを生成し、次に、元データと拡張済みデータの両方の入力に対して予測を正則化するCR損失を適用する。
- 計算コストを抑えるために、固定間隔でビームサーチデコードを用いた定期的な偽ラベル生成を実装し、モデルの新鮮さを維持する。
- 異種ドメインの状況下で、信頼度が低い偽ラベルを除外するために、事前のフィルタリングステップ(しきい値τ = -0.5)を適用する。
実験結果
リサーチクエスチョン
- RQ1ノイズのある偽ラベルによる性能劣化を効果的に緩和できるか、一貫性正則化はエンドツーエンド音声認識において有効か?
- RQ2言語的コンテンツを損なわせることなく、ASRにおける一貫性正則化に適した音声拡張の種別は何か?
- RQ3制限されたラベル付け予算下で、提案パイプラインは標準的なアクティブラーニングに比べてラベル効率をどの程度向上できるか?
- RQ4初期データとラベルなしデータが異なるドメインに属する場合、ラベルなしデータからの偽ラベルはモデル性能をどの程度向上できるか?
- RQ5トレーニング効率とモデル性能のバランスを考慮した場合、偽ラベル生成の最適な頻度は何か?
主な発見
- ラベル付け予算が全ラベルなしデータの1/3の場合、提案された+CR-SAパイプラインは標準的なアクティブラーニングに比べて文字誤り率(CER)を12.76%低減した。
- 1/10のラベル付け予算下では、従来のアクティブラーニングに比べてCERが4.02%改善された。
- ラベル付きデータが386時間のうち137時間(1/3)にとどまる状況でも、フルバッチモデルの性能から0.82パーセンテージポイント以内の差で性能を達成し、優れたラベル効率を示した。
- 一貫性正則化は偽ラベルの誤り率(P-CER)を顕著に低減し、+CR-Xsではトレーニング全体を通してP-CERが安定的かつ改善傾向にあり、正則化なしのベースラインとは対照的であった。
- 1、3、または5エポックごとの周期的偽ラベル生成では、性能低下がたった0.2パーセンテージポイントにとどまり、大規模なラベルなしデータセットを効率的に扱える。
- 異種ドメイン設定(例:AIアシスタント vs. マップナビゲーション)下では、+CR-SA-τパイプラインにより、ラベル付きデータのわずかな割合でフルバッチ性能に近い性能を回復させた。
より良い研究を、今すぐ始めましょう
論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。
クレジットカード登録不要
このレビューはAIが作成し、人間の編集者が確認しました。