Skip to main content
QUICK REVIEW

[論文レビュー] Citrinet: Closing the Gap between Non-Autoregressive and Autoregressive End-to-End Models for Automatic Speech Recognition

Somshubra Majumdar, Jagadeesh Balam|arXiv (Cornell University)|Apr 5, 2021
Speech Recognition and Synthesis参考文献 29被引用数 43
ひとこと要約

Citrinet は、外部言語モデルなしで非自己回帰 CTC モデルと自己回帰 Seq2Seq/RNN-T モデルの性能ギャップを狭める、 squeeze-and-excitation を備えた深層 1D タイムチャネル分離畳み込みの CTC ASR モデルです。

ABSTRACT

We propose Citrinet - a new end-to-end convolutional Connectionist Temporal Classification (CTC) based automatic speech recognition (ASR) model. Citrinet is deep residual neural model which uses 1D time-channel separable convolutions combined with sub-word encoding and squeeze-and-excitation. The resulting architecture significantly reduces the gap between non-autoregressive and sequence-to-sequence and transducer models. We evaluate Citrinet on LibriSpeech, TED-LIUM2, AISHELL-1 and Multilingual LibriSpeech (MLS) English speech datasets. Citrinet accuracy on these datasets is close to the best autoregressive Transducer models.

研究の動機と目的

  • エンドツーエンド ASR において非自己回帰 CTC モデルと自己回帰 Seq2Seq/RNN-T モデルの性能ギャップを bridge する動機づけ。
  • Citrinet を、1D タイムチャネル分離畳み込みと squeeze-and-excitation モジュールを強化した深い畳み込み CTC モデルとして提案。
  • 複数の標準的な ASR データセットを横断して Citrinet を評価し、先行する自己回帰モデルおよび室温ベースラインと比較する。

提案手法

  • Prolog/epilog ブロックと three mega-blocks の Residual QuartzNet 風ブロックを備えた深層残差 CTC モデルとして Citrinet を導入。
  • グローバル情報を捉えるため、kernel layouts (K4) を用いた 1D タイムチャネル分離畳み込みと squeeze-and-excitation コンテキスト モジュールを採用。
  • 評価には sub-word ユニットを用いたトークン化戦略(word-piece)と評価時の任意外部言語モデルリスコアリングを適用。
  • SpecAugment、NovoGrad 最適化アルゴリズム、コサイン LR スケジュール、標準的な音響フロントエンド(80-dim log-Mel 特徴量)で学習。
  • WER/CER への影響を調べるため、幅(C)、深さ(R)、カーネル配置、トークン化サイズを変えてバリアントを評価。

実験結果

リサーチクエスチョン

  • RQ1外部 LMs なしで、標準的な ASR ベンチマークにおいて非自己回帰 CTC モデルが自己回帰 Seq2Seq/RNN-T モデルにどれだけ近づけるか?
  • RQ2Citrinet の設計選択(カーネル配置、SE コンテキスト、幅、深さ、トークン化)が ASR 精度に最も影響を与えるのはどれか?
  • RQ3Citrinet は LibriSpeech、MLS、TED-LIUM 2、AISHELL-1 で最先端に近い性能を達成できるか?
  • RQ4SE モジュールの文脈窓サイズが認識精度に与える影響は?
  • RQ5英語 MLS での事前学習が他データセット(TED-LIUM 2、AISHELL-1)へ転移し、ファインチューニング結果にどう影響するか?

主な発見

  • Citrinet-1024 は LibriSpeech test-other で外部 LM なしの WER 6.22% を達成し、LMリスコアリングを伴う最先端自己回帰モデルとのギャップを狭める。
  • Citrinet のバリアント(例:Citrinet-1024)は、LM なしで複数データセット上で Transducer モデルの性能に近づく(例:MLS English、TED-LIUM 2 の結果)。
  • SE コンテキストは精度を大幅に改善し、より大きな SE コンテキスト ウィンドウは tested セット全体で WER/CER を低下させる傾向。
  • カーネル幅のアブレーションは最適なレンジを示し、狭すぎるまたは広すぎるカーネルは性能を劣化させ、0.75–1.0 のスケーリングが彼らの設定で最良の結果を生む。
  • モデル幅(C)と深さ(R)を増やすと一般に性能は向上するが、パラメータ数が増え、特定の構成を超えると利益の伸びが小さくなる。
  • トークナイザの語彙サイズは精度に影響を与え、極端に大きな語彙は性能を害し、非常に小さな語彙は CT 損失制約のため学習性を低下させる可能性がある。
  • 本モデルはデータセット間の事前学習(MLS English)およびドメイン特化データ(TED-LIUM 2、AISHELL-1)で fine-tuning すると、同等ベースラインと比較して CER/WER が競合的または優れている。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。