Skip to main content
QUICK REVIEW

[論文レビュー] Convolutional Speech Recognition with Pitch and Voice Quality Features

Guillermo Cámbara, Jordi Luque|arXiv (Cornell University)|Sep 2, 2020
Speech Recognition and Synthesis参考文献 28被引用数 4
ひとこと要約

本稿では、畳み込みニューラルネットワーク(Conv GLU)におけるエンドツーエンド自動音声認識(ASR)のため、メル周波数スペクトル係数(MFSC)にピッチ、ジッター、シャイマー特徴を統合する手法を提案する。MFSC入力にこれらのプロソディックおよびボイスクオリティ特徴を追加することで、スペイン語Common Voiceでは最大7%の相対的WER低減、LibriSpeechでは2.94%の低減を達成し、特に多様な環境やノイズの多い条件下でも一貫した性能向上を示した。

ABSTRACT

The effects of adding pitch and voice quality features such as jitter and shimmer to a state-of-the-art CNN model for Automatic Speech Recognition are studied in this work. Pitch features have been previously used for improving classical HMM and DNN baselines, while jitter and shimmer parameters have proven to be useful for tasks like speaker or emotion recognition. Up to our knowledge, this is the first work combining such pitch and voice quality features with modern convolutional architectures, showing improvements up to 7% and 3% relative WER points, for the publicly available Spanish Common Voice and LibriSpeech 100h datasets, respectively. Particularly, our work combines these features with mel-frequency spectral coefficients (MFSCs) to train a convolutional architecture with Gated Linear Units (Conv GLUs). Such models have shown to yield small word error rates, while being very suitable for parallel processing for online streaming recognition use cases. We have added pitch and voice quality functionality to Facebook's wav2letter speech recognition framework, and we provide with such code and recipes to the community, to carry on with further experiments. Besides, to the best of our knowledge, our Spanish Common Voice recipe is the first public Spanish recipe for wav2letter.

研究の動機と目的

  • ピッチおよびボイスクオリティ特徴(ジッター、シャイマー)が、現代の畳み込み型ASRモデルにおける性能向上に寄与するかどうかを調査すること。
  • 手作業で作成されたプロソディック特徴とエンドツーエンドのディープラーニングアーキテクチャの間のギャップを埋めること。
  • wav2letterフレームワークにおけるピッチおよびボイスクオリティ特徴のためのオープンソースレシピおよびコード統合を提供すること。
  • wav2letter用に、初めての公開可能なスペイン語Common Voiceレシピを確立すること。
  • これらの特徴が、発音の違いや声の障害を含む多様な音声条件下での耐性に与える影響を評価すること。

提案手法

  • ゲート付き線形ユニットを用いたConv GLUアーキテクチャを採用し、深く並列化可能な学習と低WRを実現する。
  • ピッチ、ジッター、シャイマー特徴は生の音声から抽出され、アーキテクチャの変更なしにMFSC入力に連結される。
  • Facebookのwav2letterフレームワークに、統合されたピッチおよびボイスクオリティ特徴抽出パイプラインを拡張する。
  • 標準的なトレーニングおよびデコードプロトコルに従い、2つの公開データセット(スペイン語Common VoiceおよびLibriSpeech 100h)を用いて実験を実施する。
  • 後処理や特別なフィルタを避けるシンプルなアプローチを採用し、入力レベルでの特徴連結に焦点を当てる。
  • 語彙誤り率(WER)を用いて、dev-clean、dev-other、test-clean、test-otherの各スプリットで性能を評価する。

実験結果

リサーチクエスチョン

  • RQ1ピッチおよびボイスクオリティ特徴(ジッター、シャイマー)は、Conv GLUのような現代の畳み込み型ASRモデルの性能向上に寄与するか?
  • RQ2これらの特徴は、ノイズの多い環境や発音の違いがあるような多様な条件下でのASRの耐性にどのように影響するか?
  • RQ3MFSCと組み合わせた場合、ピッチ、ジッター、シャイマーの相対的寄与度は何か?
  • RQ4アーキテクチャの変更なしに、入力レベルでのプロソディック特徴の単純な連結が顕著なWER低減をもたらすか?
  • RQ5英語のような高リソース言語と比較して、スペイン語のような低リソース言語のモデルにおいて、これらの特徴はどのように影響を及ぼすか?

主な発見

  • ピッチ、ジッター、シャイマー特徴の追加により、スペイン語Common Voiceデータセットでは最大7%の相対的WER低減が達成され、特にdev-otherおよびtest-otherセットで顕著な改善が見られた。
  • LibriSpeech 100hでは、MFSC+ピッチ+ジッター+シャイマーを用いたモデルがdev-cleanセットで2.94%、test-otherセットで2.87%の相対的WER低減を達成した。
  • ピッチ、ジッター、シャイマーの3つのプロソディック特徴を組み合わせた場合、すべてのテストセットで最も一貫性があり、耐性のある性能が得られた。
  • MFSC+ピッチ+ジッター+シャイマーは、MFSCのみおよびMFSC+ピッチのベースラインを上回ったことから、ボイスクオリティ特徴の追加的価値が示された。
  • ノイズの多い環境や多様なプロソディー条件(例:dev-other)では、より顕著な改善が見られたことから、発音の違いや変動への耐性が向上したと示唆された。
  • 本研究は、ピッチおよびボイスクオリティ特徴が、最小限のアーキテクチャの変更でさえも、現代の畳み込み型ASRにおいて有効であることを確認した。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。