[論文レビュー] Transformer with Bidirectional Decoder for Speech Recognition
本稿では、共有エンコーダと二重の一方向デコーダを用いて、左から右および右から左の両方向に同時に音声トークンを予測する、双方向デコーダを備えた音声Transformer(STBD)を提案する。推論段階では双方向ビームサーチを採用し、両方向からのスコアが最も高い仮説を選択することで、従来の単方向ベースライン比でCERを3.6%相対的に低減した。STBD-Bigモデルは、言語モデルの再スコアリングやデータ拡張を一切用いずに、AISHELL-1で6.64%のCERを達成した。
Attention-based models have made tremendous progress on end-to-end automatic speech recognition(ASR) recently. However, the conventional transformer-based approaches usually generate the sequence results token by token from left to right, leaving the right-to-left contexts unexploited. In this work, we introduce a bidirectional speech transformer to utilize the different directional contexts simultaneously. Specifically, the outputs of our proposed transformer include a left-to-right target, and a right-to-left target. In inference stage, we use the introduced bidirectional beam search method, which can not only generate left-to-right candidates but also generate right-to-left candidates, and determine the best hypothesis by the score. To demonstrate our proposed speech transformer with a bidirectional decoder(STBD), we conduct extensive experiments on the AISHELL-1 dataset. The results of experiments show that STBD achieves a 3.6\% relative CER reduction(CERR) over the unidirectional speech transformer baseline. Besides, the strongest model in this paper called STBD-Big can achieve 6.64\% CER on the test set, without language model rescoring and any extra data augmentation strategies.
研究の動機と目的
- 従来の左から右への自己回帰的音声Transformerが、系列生成時に右から左の文脈を無視するという制限を解消すること。
- トレーニングおよび推論の両段階で双方向文脈を組み込むことで、自己回帰的デコーディングにおける露出バイアスを軽減すること。
- 外部言語モデルやデータ拡張に依存せずに、自動音声認識性能を向上させること。
- 端末から端末へのASRにおける双方向ターゲットおよび双方向ビームサーチの有効性を調査すること。
提案手法
- モデルは共有エンコーダと二つの一方向デコーダ(左から右(L2R)および右から左(R2L)の系列生成用)を用い、両方向の同時予測を可能にする。
- トレーニング段階では、クロスエントロピー損失を用いてL2RおよびR2Lの両方のターゲットを最適化することで、ネットワークが双方向文脈から学習できるようにする。
- 推論段階では、L2RおよびR2Lデコーディングの別々のビームを維持する双方向ビームサーチを採用し、両方向からの候補を動的に更新する。
- 最終的な仮説は、L2RおよびR2Lの全候補の中から全体スコアが最も高いものに基づいて選択され、誤り伝搬の低減と耐性向上が図られる。
- 二つのデコーダ間でパラメータを共有することで、効率を維持しつつ双方向文脈学習を可能にする。
- 本手法は、キャラクタレベルのASRを対象としてAISHELL-1データセットで評価され、ビームサイズおよびデコーディング戦略に関するアブレーションスタディが実施された。

実験結果
リサーチクエスチョン
- RQ1左から右および右から左の両方向での同時予測が、自動音声認識性能の向上に寄与するか?
- RQ2標準の単方向ビームサーチと比較して、双方向ビームサーチはより優れた仮説選択を可能にするか?
- RQ3トレーニング段階で双方向ターゲットを用いることで、推論段階における誤り蓄積がどれほど低減されるか?
- RQ4言語モデルやデータ拡張を一切使用しない状況下で、双方向デコーディングはどれほど耐性を向上させるか?
主な発見
- STBDモデルは、AISHELL-1テストセットにおいて、単方向音声Transformerベースライン比で3.6%の相対的CER低減を達成した。
- STBD-Bigモデルは、言語モデルの再スコアリングやデータ拡張を一切使用せず、AISHELL-1テストセットで6.64%のCERを達成した。
- 同じモデルを用いても、双方向ビームサーチを採用することで、標準の単方向ビームサーチよりも性能が向上した。
- テスト文の49.4%が右から左デコーダによりより正確にデコードされたことから、両方向間の相補的な強みが示された。
- アブレーションスタディの結果、ビームサイズを大きくすることで性能が向上し、ビームサイズ2を超えると飽和する傾向が見られた。
- アテンションアライメントの可視化により、L2Rデコーダが左下から右上への対角線に沿って注目を向けるのに対し、R2Lデコーダは右下から左上に注目していることが確認され、方向性に応じた動作が裏付けられた。

より良い研究を、今すぐ始めましょう
論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。
クレジットカード登録不要
このレビューはAIが作成し、人間の編集者が確認しました。