[論文レビュー] Large-scale ASR Domain Adaptation using Self- and Semi-supervised Learning
本論文は、大規模な自動音声認識(ASR)ドメイン適応のための共同自己教師ありおよび半教師あり学習手法を提案する。ラベル付きターゲットドメインデータの3%のみを用いて、完全データベースラインと同等の性能を達成する。この手法は自己教師あり事前学習と信頼度フィルタリングを施したノイズあり学生訓練を組み合わせ、ターゲットドメインで相対的に13.5%のWER改善を達成し、ソースドメインでも一般化性能が向上する。
Self- and semi-supervised learning methods have been actively investigated to reduce labeled training data or enhance the model performance. However, the approach mostly focus on in-domain performance for public datasets. In this study, we utilize the combination of self- and semi-supervised learning methods to solve unseen domain adaptation problem in a large-scale production setting for online ASR model. This approach demonstrates that using the source domain data with a small fraction of the target domain data (3%) can recover the performance gap compared to a full data baseline: relative 13.5% WER improvement for target domain data.
研究の動機と目的
- トレーニングデータ(ソースドメイン)と実世界のテストデータ(ターゲットドメイン)の間に生じるドメイン不一致の課題に対処すること。
- プロダクションASRシステムにおけるドメイン適応のため、大量のラベル付きターゲットドメインデータに依存するのを減らすこと。
- 自己教師あり学習と半教師あり学習が、オフドメインおよびインドメインASR性能の向上に果たす補完的役割を調査すること。
- 最小限のラベル付きターゲットデータを用いて、モデルの一般化性能を向上させるための訓練戦略を最適化すること。
提案手法
- 共有の因果的音声エンコーダーを用いて、RNN-T損失と自己教師あり損失(例:Wav2vec2.0、APC、Wav2vec)の両方と同時にRNN-Tモデルを訓練する。
- 音声エンコーダーの最終的表現をRNN-Tおよび自己教師あり目的の両方に特化させるために、多層パーセプトロン(MLP)アダプタを用いる。
- 非因果的ティーチャーモデルを用いて、ラベルなしターゲットドメインデータのための偽ラベルを生成するノイズあり学生訓練(NST)を実施する。
- 信頼度推定モジュール(CEM)を導入して、信頼度が低い偽ラベル付き発話文をフィルタリングし、ラベル品質とモデルのロバスト性を向上させる。
- RNN-T損失をガイドとして用いることで、RNN-T損失の助けを借りてWav2vec2.0が因果的エンコーダー上で収束できるようにする共同訓練スキームを実装する。
- 損失重み付けのためのハイパーパrameter λ = 0.5 を用いて、ラベル付きソースデータとフィルタリング済みの偽ラベル付きターゲットデータの両方を用いてモデルをファインチューニングする。

実験結果
リサーチクエスチョン
- RQ1自己教師ありおよび半教師あり学習を共同で適用することで、最小限のラベル付きターゲットデータを用いて、大規模ASRシステムにおけるオフドメイン一般化ギャップを埋めることができるか?
- RQ2自己教師あり学習と半教師あり学習は、ドメイン適応およびインドメイン性能の向上にどのように異なる貢献をしているか?
- RQ3因果的でオンラインなASRモデルにおいて、自己教師あり事前学習と半教師ありファインチューニングを最適に組み合わせる訓練戦略は何か?
- RQ4偽ラベルの信頼度フィルタリングは、ソースドメインおよびターゲットドメインの両方のモデル性能にどのように影響を与えるか?
- RQ5RNN-Tと自己教師あり目的の共同訓練は、因果的Wav2vec2.0訓練における収束問題を克服できるか?
主な発見
- 自己教師ありおよび半教師あり学習を用いて、ターゲットドメインデータのラベル付き部分を3%に制限しても、完全データベースラインと比較して13.5%の相対的WER改善が達成された。
- 統合手法により、ターゲットドメインのWERは3.1%(MF)に、ソースドメインのWERは5.7%(SF)にまで低下し、100%のターゲットデータを用いた教師あり学習を上回った。
- 自己教師あり学習は全体のモデル一般化性能を向上させるが、半教師あり学習はオフドメイン一般化ギャップを直接埋める。
- 信頼度フィルタリングにより、ターゲットドメイン発話文の24%が除外されたが、ターゲットドメインのWERは3.2%から3.1%に、ソースドメインのWERは5.8%から5.7%に改善された。
- RNN-Tと自己教師あり損失の共同訓練により、Wav2vec2.0が因果的エンコーダー上で収束し、4.3%のWERを達成した。これは単体でのWav2vec2.0事前学習よりも優れた結果であった。
- 共同訓練アプローチにより、二段階の事前学習とファインチューニングに比べ、合計の訓練ステップ数を最大80%まで削減でき、収束が速く、最終的な性能も向上した。

より良い研究を、今すぐ始めましょう
論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。
クレジットカード登録不要
このレビューはAIが作成し、人間の編集者が確認しました。