Skip to main content
QUICK REVIEW

[論文レビュー] Multilingual Speech Recognition With A Single End-To-End Model

Shubham Toshniwal, Tara N. Sainath|arXiv (Cornell University)|Nov 6, 2017
Speech Recognition and Synthesis参考文献 10被引用数 17
ひとこと要約

本論文は、9つのインド諸言語(表記の重複が最小限)をカバーする一貫したエンドツーエンドのシーケンス・ツー・シーケンスモデルを提案する。言語固有のグラフム集合の集合体を用いて、明示的な言語監督なしに共同学習することで、単言語ベースラインと比較して21%の相対的WER削減を達成し、言語条件付きエンコーダ入力を導入することでさらに7%向上を達成した。これは、強力なクロスリンガル一般化と暗黙的な言語分離を示している。

ABSTRACT

Training a conventional automatic speech recognition (ASR) system to support multiple languages is challenging because the sub-word unit, lexicon and word inventories are typically language specific. In contrast, sequence-to-sequence models are well suited for multilingual ASR because they encapsulate an acoustic, pronunciation and language model jointly in a single network. In this work we present a single sequence-to-sequence ASR model trained on 9 different Indian languages, which have very little overlap in their scripts. Specifically, we take a union of language-specific grapheme sets and train a grapheme-based sequence-to-sequence model jointly on data from all languages. We find that this model, which is not explicitly given any information about language identity, improves recognition performance by 21% relative compared to analogous sequence-to-sequence models trained on each language individually. By modifying the model to accept a language identifier as an additional input feature, we further improve performance by an additional 7% relative and eliminate confusion between different languages.

研究の動機と目的

  • 限られたデータと言語固有のコンponentsを有する多言語ASRシステムの訓練という課題に対処すること。
  • 顕著な表記および発音の違いがあるにもかかわらず、統一されたシーケンス・ツー・シーケンスモデルが複数のインド諸言語を同時に学習できるかを検討すること。
  • 言語アイデンティティの条件付けがモデル性能および言語の混同に与える影響を評価すること。
  • モデルが言語間のコードスイッチングを実行できるか、および言語モデルが音声モデルをどれほど支配するかを調査すること。

提案手法

  • 9つのインド諸言語の言語固有のグラフム集合の集合体を用いて、1つのアテンションベースのシーケンス・ツー・シーケンスモデルを訓練する。
  • リスニング・アテンション・スパルクリング(LAS)アーキテクチャを採用し、双方向RNNエンコーダと単方向RNNデコーダを用いる。
  • エンコーダの入力として言語識別子を追加の特徴として導入し、言語に配慮したモデリングを可能にする。
  • エンコーダの状態から導出されるコンテキストベクトルを用いて、音声特徴と予測グラフム列のアラインメントにアテンション機構を適用する。
  • フレームスタッキングとストライドを用いて、80次元のログメル特徴をスタックし、シーケンス長を短縮する。
  • 合成データ、言語不一致実験、コードスイッチングテストを通じて、モデルの挙動を評価する。

実験結果

リサーチクエスチョン

  • RQ1言語アイデンティティが提供されない場合、統合多言語モデルはどの程度言語を混同するか?
  • RQ2訓練時に一緒に見られなかったインド諸言語間で、モデルはコードスイッチングを実行できるか?
  • RQ3エンコーダを言語アイデンティティで条件づけることで、認識精度と言語の忠実度はどの程度向上するか?
  • RQ4統合モデルにおいて、言語モデルが音声モデルをどの程度支配するか?
  • RQ5モデルは音声・発音的コンテンツと言語アイデンティティを分離した表現を学習するか?

主な発見

  • 統合多言語モデルは、各言語で個別に訓練された単言語モデルと比較して、21%の相対的WER削減を達成した。
  • 言語アイデンティティの条件付けを追加することで、さらに7%の相対的性能向上が得られ、言語の混同が解消された。
  • モデルは混合表記の出力をほとんど生成せず、明示的でない監視のもとでも強い暗黙の言語識別を示している。
  • 合成された混合言語発話において、モデルはタミル語とヒンディー語間のコードスイッチングを実行できず、言語モデルが音声モデルを支配していることが示唆された。
  • ウルドゥー語の音声にヒンディー語の言語IDが与えられた場合、モデルは音声をヒンディー語の表記に変換した。これは、発音的コンテンツと言語アイデンティティが分離されていることを示している。
  • エンコーダを条件づけたモデルは、入力音声が不一致言語からのものであっても、提供された言語IDに非常に忠実に従った。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。