Skip to main content
QUICK REVIEW

[論文レビュー] Learning Speech Rate in Speech Recognition

Xiangyu Zeng, Shi Yin|arXiv (Cornell University)|Jun 2, 2015
Speech Recognition and Synthesis参考文献 11被引用数 3
ひとこと要約

本論文は、話者の発話速度(ROS)の変動を補正するための深層ニューラルネットワーク(DNN)ベースの手法を提案する。ROSを入力特徴として組み込むことで、異常に遅いか速いかの発話によって引き起こされるスペクトル歪みをモデルが学習・軽減できるようにする。この手法は、通常速度の認識性能を損なうことなく、遅い発話および速い発話の両方で一貫した性能向上を達成する。さらに、HMM遷移の適応を組み合わせることでさらなる改善が得られ、ROSが発話信号の時間的およびスペクトル的特性に影響を与えることを確認した。

ABSTRACT

A significant performance reduction is often observed in speech recognition when the rate of speech (ROS) is too low or too high. Most of present approaches to addressing the ROS variation focus on the change of speech signals in dynamic properties caused by ROS, and accordingly modify the dynamic model, e.g., the transition probabilities of the hidden Markov model (HMM). However, an abnormal ROS changes not only the dynamic but also the static property of speech signals, and thus can not be compensated for purely by modifying the dynamic model. This paper proposes an ROS learning approach based on deep neural networks (DNN), which involves an ROS feature as the input of the DNN model and so the spectrum distortion caused by ROS can be learned and compensated for. The experimental results show that this approach can deliver better performance for too slow and too fast utterances, demonstrating our conjecture that ROS impacts both the dynamic and the static property of speech. In addition, the proposed approach can be combined with the conventional HMM transition adaptation method, offering additional performance gains.

研究の動機と目的

  • 異常な低速または高速な発話速度によって引き起こされる音声認識性能の低下を是正すること。
  • 発話速度の変動が、時間的(動的)な性質に加え、スペクトル的(静的)な性質にも影響を与えるかどうかを調査すること。
  • 発話速度の変動によって生じるスペクトル歪みを学習・補正するDNNベースの補正手法を開発すること。
  • DNNベースのスペクトル補正と従来のHMM遷移適応を組み合わせることで、相補的な性能向上が得られることを実証すること。

提案手法

  • DNN音声モデルの追加入力特徴として発話速度(ROS)を導入し、ネットワークがROS依存のパターンを学習できるようにする。
  • ROS値を入力として使用して、教師あり学習によりDNNモデルを訓練し、極端な発話速度によって引き起こされるスペクトル歪みを学習・補正できるようにする。
  • 離散的カテゴリ(例:遅い/速い)ではなく、連続的なROS値を入力として使用することで、異なる発話速度間でのパラメータ共有が滑らかになり、データの効率的利用が可能になる。
  • HMM遷移構造を変更せずに、標準的なDNN音声モデルフレームワーク内にDNNベースのROS補正を実装する。
  • DNNベースの補正と従来のHMM遷移適応(例:自己遷移確率の調整)を組み合わせ、スペクトル的および時間的歪みの両方に対処する。
  • 極端なROSを持つテストセット(遅い:1秒あたり6フォンム未塔、速い:1秒あたり6フォンム以上)で評価を行い、GMMおよびDNNベースラインと性能を比較する。

実験結果

リサーチクエスチョン

  • RQ1発話速度の変動は、音声ユニットの持続時間に加え、音声信号のスペクトル特性にも影響を与えるか?
  • RQ2DNNベースの音声モデルは、異常な発話速度によって生じるスペクトル歪みを効果的に学習・補正できるか?
  • RQ3DNNベースのROS補正による性能向上は、HMM遷移適応とは独立しているか、それとも相補的か?
  • RQ4連続的なROSを入力特徴として組み込むことで、発話速度の離散的分類よりも一般化性能が向上するか?
  • RQ5提案手法は、通常速度の音声認識性能を損なわず、遅い発話および速い発話の両方で認識精度を向上させられるか?

主な発見

  • DNNベースのROS補正手法は、遅い発話および速い発話の両方で顕著な性能向上を達成し、非常に遅い発話(<4フォンム/秒)ではWERを45.71%から44.92%に、非常に速い発話(>10フォンム/秒)では31.22%から29.54%に低下させた。
  • HMMベースの遷移適応手法は、速い発話の性能を向上させた(31.22%から30.13%にWER低下)が、遅い発話の性能向上には失敗しており、遅い発話の性能低下が時間的歪みに起因するだけではないことを示している。
  • DNNベースのスペクトル補正とHMMベースの時間的適応を組み合わせることでさらなる性能向上が得られ、速い発話ではWERが29.08%に低下した。これは、ROS変動がスペクトル的および時間的歪みを引き起こすことを確認した。
  • 遅いまたは速い発話のみで訓練すると、不一致なテストセットで顕著な性能低下が生じ、訓練データに多様なROSを含める重要性を示している。
  • DNNベースの手法は、通常速度の認識性能を損なわず、すべてのROS条件下で性能向上を達成しており、そのロバスト性および一般化能力を示している。
  • 結果は、ROSが音声の動的(時間的)および静的(スペクトル的)特性に影響を与えることを確認しており、スペクトル歪みはHMM適応のみでは補正できないことを示している。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。