[論文レビュー] One In A Hundred: Select The Best Predicted Sequence from Numerous Candidates for Streaming Speech Recognition
本稿では、CTCデコーダーを用いて数百の候補発話文を生成し、変換器ベースの条件付き言語モデルで最良のものを選択することで、CTCモデルを向上させる2段階のストリーミング音声認識モデルを提案する。この手法は、AISHELL-1中国語データセットにおいて、最大20%の文字誤り率(CER)の相対的低減を達成しながら、低遅延のストリーミング推論を維持している。
The RNN-Transducers and improved attention-based encoder-decoder models are widely applied to streaming speech recognition. Compared with these two end-to-end models, the CTC model is more efficient in training and inference. However, it cannot capture the linguistic dependencies between the output tokens. Inspired by the success of two-pass end-to-end models, we introduce a transformer decoder and the two-stage inference method into the streaming CTC model. During inference, the CTC decoder first generates many candidates in a streaming fashion. Then the transformer decoder selects the best candidate based on the corresponding acoustic encoded states. The second-stage transformer decoder can be regarded as a conditional language model. We assume that a large enough number and enough diversity of candidates generated in the first stage can compensate the CTC model for the lack of language modeling ability. All the experiments are conducted on a Chinese Mandarin dataset AISHELL-1. The results show that our proposed model can implement streaming decoding in a fast and straightforward way. Our model can achieve up to a 20% reduction in the character error rate than the baseline CTC model. In addition, our model can also perform non-streaming inference with only a little performance degradation.
研究の動機と目的
- ストリーミングCTCモデルにおける言語的文脈モデリングの欠如が、ストリーミング音声認識性能を制限することに対処する。
- CTCの高速性と変換器デコーダーの言語モデリング能力を組み合わせることで、ストリーミング推論の効率性と正確性を向上させる。
- 大規模かつ多様なCTC生成候補群が、CTCの固有のシーケンスレベルの言語モデリング能力の欠如を補うことができるかどうかを検証する。
- 最小限の性能低下でストリーミングおよび非ストリーミング推論を両立できるようにする。
提案手法
- 遅延制御付きストリーミング変換器エンコーダー(LC-STE)は、局所的自己注意機構と限定的な将来の文脈層を用いて、リアルタイムで入力特徴を処理し、低遅延を維持する。
- CTCデコーダーは、事前選択段階でストリーミング形式で最大100の候補発話文を生成する。
- 変換器デコーダーは、対応する音声エンコーダー状態を用いて、すべての候補に対して1ステップスコアリングを実行し、条件付き言語モデルとして機能する。
- 最終的な仮説は、すべての候補の平均スコアが最大のものとして選択される。
- エンコーダー、CTCデコーダー、変換器デコーダーの共同学習により、アライメントとパフォーマンス最適化が保証される。
- リアルタイム制約を無効化することで、ストリーミング(遅延制御あり)および非ストリーミング推論を両立できる。
実験結果
リサーチクエスチョン
- RQ1大規模かつ多様なCTC生成候補群は、CTCモデルの言語モデリング能力の欠如を補うことができるか?
- RQ2変換器ベースのスコアラーを備えた2段階推論パイプラインは、標準的なCTCよりもストリーミング音声認識性能を向上させるか?
- RQ3本手法は、非ストリーミングまたはより複雑なエンドツーエンドモデルと同等の性能を維持しながら、低遅延を実現できるか?
- RQ4CTCデコーディング段階におけるビーム幅が、2段階システムの最終的なパフォーマンスにどのように影響するか?
- RQ5OAH手法を用いる際の、ストリーミング効率と認識正確性のトレードオフは何か?
主な発見
- 提案されたOAHモデルは、AISHELL-1データセットにおいて、ベースラインCTCモデルと比較して最大20%の相対的CER低減を達成した。
- ビーム幅50の場合、テストセットでCER 7.41%を達成し、ベースラインCTCおよび同期変換器(Sync-Transformer)やSA-Transducerなどの他のストリーミングモデルを上回った。
- リアルタイム要因(RTF)は0.0380を維持しており、SA-Transducer(RTF 0.1536)やSpeech-Transformer(RTF 0.0564)と比較して顕著に優れている。
- 非ストリーミング推論ではCER 7.05%を達成し、ストリーミング版と比較して僅かな性能低下にとどまった。
- ビーム幅が50を上回ると、低品質の高スコア候補によるノイズの増加が原因で性能劣化が生じた。
- OAHを用いたモデルは、外部言語モデル(例:RNNLMやTransLMのリスコアリング)を用いたCTCモデルを上回り、内部の2段階メカニズムの有効性を示した。
より良い研究を、今すぐ始めましょう
論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。
クレジットカード登録不要
このレビューはAIが作成し、人間の編集者が確認しました。