Skip to main content
QUICK REVIEW

[論文レビュー] Adaptation of Whisper models to child speech recognition

Rishabh Jain, Andrei Barcovschi|arXiv (Cornell University)|Jul 24, 2023
Speech Recognition and SynthesisComputer Science被引用数 3
ひとこと要約

この論文は、子供の発話データにマルチリンガル Whisper ASR モデルをファインチューニングすることで、認識性能の向上を検討している。ファインチューニングにより、元のモデルよりも顕著な ASR の向上が得られることを示しているが、子供のデータでファインチューニングされた自己教師あり wav2vec2 モデルが、両方の Whisper バリエーションを上回る性能を発揮している。

ABSTRACT

Automatic Speech Recognition (ASR) systems often struggle with transcribing child speech due to the lack of large child speech datasets required to accurately train child-friendly ASR models. However, there are huge amounts of annotated adult speech datasets which were used to create multilingual ASR models, such as Whisper. Our work aims to explore whether such models can be adapted to child speech to improve ASR for children. In addition, we compare Whisper child-adaptations with finetuned self-supervised models, such as wav2vec2. We demonstrate that finetuning Whisper on child speech yields significant improvements in ASR performance on child speech, compared to non finetuned Whisper models. Additionally, utilizing self-supervised Wav2vec2 models that have been finetuned on child speech outperforms Whisper finetuning.

研究の動機と目的

  • 注釈付きの子供の発話データセットが限られていることによる、子供の発話における ASR 性能の低さという課題に対処する。
  • Whisper のような事前学習済みマルチリンガル ASR モデルが、限られたファインチューニングデータを用いて子供の発話に効果的に適応できるかを調査する。
  • 子供の発話認識において、ファインチューニングされた Whisper モデルと、wav2vec2 のような自己教師ありモデルの性能を比較する。
  • リソースが限られた環境下で、大人の発話での事前学習から子供の発話への適応へのトランスファー学習の有効性を評価する。

提案手法

  • 子供の声の特徴に適応させるために、収集済みの子供の発話データセット上で、事前学習済みの Whisper base および large モデルをファインチューニングする。
  • Whisper の初期モデル重みの取得に、既存の大量の大人の発話データセットを用いる。
  • 比較的性能評価のため、同じ子供の発話データセット上で自己教師あり wav2vec2 モデルをファインチューニングする。
  • スペクトルオーグメンテーション、学習率スケジューリング、早期停止を含む、標準的な ASR 学習手順をファインチューニング中に適用する。
  • 保持された子供の発話テストセット上で、語誤り率(WER)などの標準的な ASR メトリクスを用いて、すべてのモデルを評価する。
  • 可能な限り同じハイパーパramータとデータ分割を用いて、公平な比較を保証する。

実験結果

リサーチクエスチョン

  • RQ1子供の発話データに Whisper モデルをファインチューニングすることで、元の事前学習済みモデルと比較して、ASR 性能が顕著に向上するか?
  • RQ2同じ子供の発話データにファインチューニングされた self-supervised wav2vec2 モデルと比較して、ファインチューニング済み Whisper の性能はどの程度か?
  • RQ3限られた子供のデータでファインチューニングする際、大人の発話での事前学習からのトランスファー学習が、子供の発話認識にどの程度寄与するか?
  • RQ4モデルアーキテクチャと事前学習データの分布が、子供の発話認識精度に与える相対的な影響は何か?

主な発見

  • 子供の発話データに Whisper をファインチューニングすることで、非ファインチューニングの base モデルと比較して、語誤り率(WER)が顕著に低下する。
  • ファインチューニング済み Whisper モデルは、元の Whisper モデルよりも子供の発話で顕著に高い性能を発揮しており、子供の声の特徴への効果的な適応が示された。
  • 子供の発話データにファインチューニングされた自己教師あり wav2vec2 モデルは、元のモデルおよびファインチューニング済み Whisper モデルの両方を WER の観点で上回る性能を発揮した。
  • Whisper と wav2vec2 の性能差は、下流の ASR タスクにおいて、子供に特化したデータでの自己教師あり事前学習の優位性を示している。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。