[論文レビュー] Research on Modeling Units of Transformer Transducer for Mandarin Speech Recognition
本稿では、エンドツーエンドの中国語音声認識を目的としたハイブリッド自己注意TransformerとRNNアーキテクチャ—Transformer Transducer—を提案する。音声認識性能が最も優れるのは、声調を含む音節をモデリング単位とした場合である。本手法は、声調を含む音節初期/終端のモデルと比較して14.4%の相対的WER低減を達成し、文字レベルのモデリングと比較して44.1%の低減を示す。また、8kHzおよび16kHz音声の両方で堅牢な認識を可能にする、新しいミックス帯域幅トレーニング手法を導入している。
Modeling unit and model architecture are two key factors of Recurrent Neural Network Transducer (RNN-T) in end-to-end speech recognition. To improve the performance of RNN-T for Mandarin speech recognition task, a novel transformer transducer with the combination architecture of self-attention transformer and RNN is proposed. And then the choice of different modeling units for transformer transducer is explored. In addition, we present a new mix-bandwidth training method to obtain a general model that is able to accurately recognize Mandarin speech with different sampling rates simultaneously. All of our experiments are conducted on about 12,000 hours of Mandarin speech with sampling rate in 8kHz and 16kHz. Experimental results show that Mandarin transformer transducer using syllable with tone achieves the best performance. It yields an average of 14.4% and 44.1% relative Word Error Rate (WER) reduction when compared with the models using syllable initial/final with tone and Chinese character, respectively. Also, it outperforms the model based on syllable initial/final with tone with an average of 13.5% relative Character Error Rate (CER) reduction.
研究の動機と目的
- エンドツーエンドの中国語音声認識性能を、Transformer Transducerアーキテクチャを用いて向上させること。
- 文字、音節(声調を含む)、音節の初期/終端部(声調を含む)といった異なるモデリング単位が認識精度に与える影響を調査すること。
- 新しいトレーニング戦略を用いて、8kHzおよび16kHzといった多様なサンプリングレートを処理できる汎用モデルを開発すること。
- 低リソース、大規模語彙の中国語ASRにおいて、モデルの複雑さと認識精度のトレードオフを最適化すること。
提案手法
- 自己注意メカニズムとRNNコンponentsを組み合わせたハイブリッドTransformer Transducerモデルを提案し、文脈モデリングを強化する。
- 8kHzおよび16kHzの音声データを同時にトレーニングすることで、1つの堅牢なモデルを生成する、新しいミックス帯域幅トレーニング手法を採用する。
- 中国語の文字、声調を含む音節、声調を含む音節の初期/終端部という複数のモデリング単位を評価する。
- 両方のサンプリングレートで合計約12,000時間の中国語音声データを用いてモデルをトレーニングおよびファインチューニングする。
- ラベルスムージングを適用したクロスエントロピー損失と、ConformerスタイルのフィードフォワードネットワークをTransformerブロック内に使用する。
- トレーニング中にCTC-アテンションの同時アライメントを適用し、アテンション学習の安定化と音声出力とテキスト出力のアライメント向上を図る。
実験結果
リサーチクエスチョン
- RQ1文字、声調を含む音節、音節の初期/終端部(声調を含む)というモデリング単位の中で、中国語音声認識の認識精度が最も高いのはどれか?
- RQ2別々の再トレーニングなしに、1つのTransformer Transducerモデルが8kHzおよび16kHz音声の両方で堅牢な性能を発揮できるか?
- RQ3標準的な単一帯域幅トレーニングと比較して、提案されたミックス帯域幅トレーニング手法は一般化性能および誤り率において優れているか?
- RQ4純粋なTransformerやRNN-Tと比較して、自己注意とRNNコンponentsを組み合わせたアーキテクチャが、中国語音声における長距離依存関係のモデリングを改善するか?
- RQ5声調を含む音節モデリングは、文字レベルモデリングと比較して、WERおよびCERの観点でどの程度の相対的性能向上をもたらすか?
主な発見
- 声調を含む音節をモデリング単位とした場合、最も低い単語誤り率(WER)を達成し、音節の初期/終端部(声調を含む)を用いたモデルと比較して14.4%の相対的WER低減を示した。
- 声調を含む音節モデルは、文字レベルモデリングと比較して44.1%の相対的WER低減を達成し、顕著な性能向上を示した。
- 声調を含む音節モデルは、音節の初期/終端部(声調を含む)ベースラインと比較して、文字誤り率(CER)を13.5%相対的に低減した。
- ミックス帯域幅トレーニング手法により、1つのモデルが8kHzおよび16kHz音声の両方で一般化可能であり、ファインチューニングなしに両方の環境で高い精度を維持した。
- ハイブリッドTransformer Transducerアーキテクチャは、標準的なRNN-Tや純粋なTransformerベースのモデルと比較して、中国語音声認識における耐性および精度の面で優れた性能を示した。
- 結果から、モデリング単位が性能に顕著な影響を及ぼすことが確認され、声調を含む音節が中国語(声調言語で、高い語彙的複雑性を持つ)にとって最適であることが示された。
より良い研究を、今すぐ始めましょう
論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。
クレジットカード登録不要
このレビューはAIが作成し、人間の編集者が確認しました。