Skip to main content
QUICK REVIEW

[論文レビュー] Enhancing ASR for Stuttered Speech with Limited Data Using Detect and Pass

Olabanji Shonibare, Xiaosu Tong|arXiv (Cornell University)|Feb 8, 2022
Stuttering Research and Treatment被引用数 12
ひとこと要約

本論文は、少量のラベル付きデータを用いて、ステッタードスピークのASRパフォーマンスを向上させる軽量な手法「Detect and Pass」を提案する。文脈に配慮した分類器を訓練し、その分類器がステッタードフレームを検出すると、推論時にこれらのフレームとその後方確率をASRモデルに渡す。これにより、最先端のRNN-Tモデルを対象に、語彙誤り率(WER)を最大71.24%まで低減する。特に、小型のASRモデルにおいて顕著な効果を示す。

ABSTRACT

It is estimated that around 70 million people worldwide are affected by a speech disorder called stuttering. With recent advances in Automatic Speech Recognition (ASR), voice assistants are increasingly useful in our everyday lives. Many technologies in education, retail, telecommunication and healthcare can now be operated through voice. Unfortunately, these benefits are not accessible for People Who Stutter (PWS). We propose a simple but effective method called 'Detect and Pass' to make modern ASR systems accessible for People Who Stutter in a limited data setting. The algorithm uses a context aware classifier trained on a limited amount of data, to detect acoustic frames that contain stutter. To improve robustness on stuttered speech, this extra information is passed on to the ASR model to be utilized during inference. Our experiments show a reduction of 12.18% to 71.24% in Word Error Rate (WER) across various state of the art ASR systems. Upon varying the threshold of the associated posterior probability of stutter for each stacked frame used in determining low frame rate (LFR) acoustic features, we were able to determine an optimal setting that reduced the WER by 23.93% to 71.67% across different ASR systems.

研究の動機と目的

  • 訓練データにおけるマジョリタリー・バイアスのため、ASRシステムがステッタードスピークに対して性能を発揮できない問題に対処すること。
  • データ量が少ない状況下でも、ステッタリングを経験する人々(PWS)のASRの耐障害性を高める手法を開発すること。
  • 主なASRモデルの再トレーニングを伴わずに、単純で軽量な検出およびリダイレクト機構が、WERを顕著に低減できるかどうかを評価すること。
  • ASR推論と組み合わせるための、最適なフレームレベルのしきい値と投票戦略を特定すること。

提案手法

  • 音声を重複のない100msフレームに分割し、トレーニング済みの音声分類器を用いて各フレームにステッタリングが含まれるかを予測する。
  • 分類器は各フレームの後方確率を出力し、ステッタリングの可能性を示す。
  • 後方確率が高いためにステッタードと判定されたフレームは、推論時に別個の入力ストリームとしてASRモデルに渡される。
  • LFR特徴量は3つの連続フレームをスタックすることで作成され、多数決、いずれか、平均しきい値など、さまざまな投票戦略を適用して各LFRフレームの最終的なステッタリングラベルを決定する。
  • ASRモデルは元の入力に加えて、検出されたステッタードフレームも処理することで、不順な領域に注意を集中させることができる。
  • 本手法は、微調整を伴わずRNN-TベースのASRモデルに適用可能であり、プラグイン型の強化手段である。

実験結果

リサーチクエスチョン

  • RQ1単純でデータ効率の良い分類器は、高い正確性で音声内のステッタードフレームを検出可能か?
  • RQ2検出されたステッタードフレームとその後方確率をASRモデルに渡すことで、ステッタードスピークにおけるWERが低減するか?
  • RQ3異なるデータ量でトレーニングされたASRモデルにおいて、Detect and Pass手法の性能はどのように変化するか?
  • RQ4多数決、平均しきい値など、フレームレベルの集約戦略(例:多数決、任意の条件、平均しきい値)の中で、最も優れたWER低減を達成するのはどれか?
  • RQ5LFRベースの推論パイプラインにおいて、WER低減を最大化するための後方確率の最適なしきい値は何か?

主な発見

  • Detect and Pass手法は、20万時間のデータでトレーニングされたRNN-T1モデルにおいて、WERを最大71.24%まで低減した。
  • より大きなモデル(RNN-T2、RNN-T3)では、WER低減率は低かったが依然として有意であり、それぞれ38.03%および12.18%の低減を達成した。
  • 平均後方確率の最適なしきい値は0.8であった。この値を用いることで、RNN-T3では23.93%のWER低減が達成された。
  • 'any_0'投票戦略は、RNN-T1のような小型モデルにおいて最も優れた性能を示したが、より大きなモデルでは高いしきい値(0.8)が最適であった。
  • 本手法は累積的改善を示し、小型ASRモデルに対してより大きな恩恵をもたらした。これは、データ量が限られる状況下での価値を示している。
  • 分類器はテストセットでPR-AUC > 75%を達成し、限られたデータ環境下でも「十分な性能」の検出器としての有効性が裏付けられた。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。