Skip to main content
QUICK REVIEW

[論文レビュー] Open Source Automatic Speech Recognition for German

Benjamin Milde, Arne Köhn|arXiv (Cornell University)|Jul 26, 2018
Speech Recognition and Synthesis被引用数 12
ひとこと要約

本論文では、Kaldiツールキットを用いて、Tuda-DeおよびSpoken Wikipedia Corpus(SWC)データセットの合計412時間の読み上げ音声を用いて学習された、ドイツ語向けの無料で利用可能なオープンソース音声認識(ASR)モデルを提示する。Spoken Wikipediaデータを組み込むことで、Tuda-Deテストセットにおける最終的な語誤り率(WER)は14.38%にまで低下し、相対的に26%のWER低減が達成された。また、話者の違いやマイクの種類に対する高い耐性を示した。

ABSTRACT

High quality Automatic Speech Recognition (ASR) is a prerequisite for speech-based applications and research. While state-of-the-art ASR software is freely available, the language dependent acoustic models are lacking for languages other than English, due to the limited amount of freely available training data. We train acoustic models for German with Kaldi on two datasets, which are both distributed under a Creative Commons license. The resulting model is freely redistributable, lowering the cost of entry for German ASR. The models are trained on a total of 412 hours of German read speech data and we achieve a relative word error reduction of 26% by adding data from the Spoken Wikipedia Corpus to the previously best freely available German acoustic model recipe and dataset. Our best model achieves a word error rate of 14.38 on the Tuda-De test set. Due to the large amount of speakers and the diversity of topics included in the training data, our model is robust against speaker variation and topic shift.

研究の動機と目的

  • 自由に利用可能な学習データを用いて、高品質なオープンソースのドイツ語ASR音声モデルを開発すること。
  • 完全に再配布可能なモデルと学習レシピを提供することで、ドイツ語ASRの導入障壁を低減すること。
  • データ拡張とモデル最適化を用いて、以前までに利用可能だった最高のオープンソースドイツ語ASRモデルを上回ること。
  • クラウドベースの音声APIに依存しないことで、プライバシーを守りつつローカルに展開可能なASRシステムを可能にすること。
  • ボランティアが寄付した自動的にアラインメントされた音声データ(Spoken Wikipedia)を用いて、頑丈なASRモデルを学習する可能性を示すこと。

提案手法

  • Tuda-DeおよびSpoken Wikipedia Corpus(SWC)という2つのオープンソースデータセットを用いて、Kaldi ASRツールキットで音声モデルを学習する。
  • 長時間にわたる部分的にアラインメントされた音声録音を処理するため、Sphinxベースのアラインメントと反復的なモデル再トレーニングを適用する。
  • 音声活動検出(VAD)に基づくスニペット抽出法を用いて、訓練に適した連続した音声セグメントを抽出する。
  • GMM-HMMおよびTDNN-HMMアーキテクチャを標準的なKaldiレシピに従って使用し、言語モデルの再スコアリングを実施する。
  • SWCデータに対して保守的で最小限のプルーニング戦略を適用し、データ品質と量のバランスを取る。
  • オープンボキャブラリー環境における未知語(OOV)を処理するため、サブワードまたはOOV音素辞書エントリを自動生成する。

実験結果

リサーチクエスチョン

  • RQ1自由に利用可能なパブリックライセンスの音声データのみを用いて、高性能なオープンソースドイツ語ASRモデルを学習できるか?
  • RQ2Spoken Wikipedia Corpusの追加が、既存のオープンソースドイツ語ASRモデルの性能にどのように寄与するか?
  • RQ3読み上げ音声のみで学習されたモデルが、Verbmobilコーパスに見られるような自然な会話音声にどれほど一般化できるか?
  • RQ4実際の録音環境下で、話者の違いやマイクの種類によってモデルの性能がどのように変化するか?
  • RQ5Spoken Wikipediaプロジェクトの継続的成長を考慮すると、将来的に新しいデータでモデルを効果的に拡張できるか?

主な発見

  • Spoken Wikipediaデータを統合した後、Tuda-Deテストセットにおける語誤り率(WER)は14.38%にまで低下し、以前までに利用可能だった最高のオープンソースモデルと比較して26%の相対的WER低減が達成された。
  • 285時間分のSpoken Wikipediaデータの追加により性能が著しく向上し、最終的なモデルは話者の違いやマイクの多様性に対して強い耐性を示した。
  • Verbmobil(VM1)テストセットでは、ドメイン特化語彙を用いた場合、WERは20.04%にまで低下し、読み上げ音声での学習にもかかわらず会話音声処理においても妥当な性能を示した。
  • モデルは多様な録音環境でも良好に動作し、実際のRealtekマイクデータではわずかな性能低下が見られたが、これはハードウェア由来の歪みのため公式評価から除外された。
  • トレーニングレシピと事前学習済みモデルはGitHubで公開されており、将来的な研究や応用における再現性と拡張性を可能にしている。
  • モデルの性能は語彙サイズに極めて敏感であり、大規模語彙モデルでは顕著に誤り率が上昇する傾向にあり、ドイツ語ASRにおいてサブワードまたは語幹分解アプローチの必要性が示唆された。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。