Skip to main content
QUICK REVIEW

[論文レビュー] Non-autoregressive End-to-end Speech Translation with Parallel Autoregressive Rescoring

Hirofumi Inaguma, Yosuke Higuchi|arXiv (Cornell University)|Sep 9, 2021
Natural Language Processing Techniques参考文献 94被引用数 4
ひとこと要約

本稿では、非自己回帰的(NAR)でエンドツーエンドの音声翻訳フレームワークであるOrthrosを提案する。この手法は、推論速度を損なわずに翻訳品質を向上させるために、並列な自己回帰的再スコアリング機構を用いる。NARデコーダーと軽量な自己回帰的(AR)デコーダーを同時に学習させることで、Orthrosは自己回帰的モデルと同等のBLEUスコアを達成しつつ、CPU上で最大3.63倍の高速化を実現した。特に、ConformerエンコーダーとCTCベースのデコーダーを用いる場合に顕著である。

ABSTRACT

This article describes an efficient end-to-end speech translation (E2E-ST) framework based on non-autoregressive (NAR) models. End-to-end speech translation models have several advantages over traditional cascade systems such as inference latency reduction. However, conventional AR decoding methods are not fast enough because each token is generated incrementally. NAR models, however, can accelerate the decoding speed by generating multiple tokens in parallel on the basis of the token-wise conditional independence assumption. We propose a unified NAR E2E-ST framework called Orthros, which has an NAR decoder and an auxiliary shallow AR decoder on top of the shared encoder. The auxiliary shallow AR decoder selects the best hypothesis by rescoring multiple candidates generated from the NAR decoder in parallel (parallel AR rescoring). We adopt conditional masked language model (CMLM) and a connectionist temporal classification (CTC)-based model as NAR decoders for Orthros, referred to as Orthros-CMLM and Orthros-CTC, respectively. We also propose two training methods to enhance the CMLM decoder. Experimental evaluations on three benchmark datasets with six language directions demonstrated that Orthros achieved large improvements in translation quality with a very small overhead compared with the baseline NAR model. Moreover, the Conformer encoder architecture enabled large quality improvements, especially for CTC-based models. Orthros-CTC with the Conformer encoder increased decoding speed by 3.63x on CPU with translation quality comparable to that of an AR model.

研究の動機と目的

  • 非自己回帰的(NAR)モデルの品質と速度のトレードオフを解消し、翻訳品質を損なわず推論速度を向上させること。
  • NARモデルの探索性と仮説選択を改善すること。NARモデルは、弱いシーケンスレベルのスコアリングにより最適な翻訳を特定できないことがしばしばある。
  • NARデコーダーと補助的な自己回帰的(AR)デコーダーを共有エンコーダーで統合する包括的なフレームワークを構築すること。
  • マルチマスク学習とテキスト専用のNAR機械翻訳(MT)タスクを用いた共同事前学習により、条件付きマスクド言語モデル(CMLM)デコーダーの訓練を強化すること。
  • Conformerエンコーダーが、複数の言語方向と音声長にわたり、NARモデルの性能を向上させる効果を評価すること。

提案手法

  • 共有エンコーダー、非自己回帰的(NAR)デコーダー、および補助的な浅い自己回帰的(AR)デコーダーを備えた統合的NAR E2E-STフレームワークであるOrthrosを導入する。
  • 並列AR再スコアリングを採用:長さが異なる複数のNAR生成仮説が、同時にARデコーダーによってスコア付けされ、最良の翻訳が選択される。
  • 条件付きマスクド言語モデル(CMLM)およびコネクティスト・テンポラル・クラスフィケーション(CTC)ベースのモデルをNARデコーダーとして用い、それぞれOrthros-CMLMおよびOrthros-CTCと呼ぶ。
  • CMLMデコーダーの一般化を向上させるために、各サンプルに対して複数の入力ビューを露出させるマルチマスク学習(MMT)を適用する。
  • CMLMデコーダーの性能を向上させるために、テキスト入力のNAR MTタスクと共同で学習する。
  • 表現学習を強化し、特に長時間の音声に対して効果を発揮するため、Conformerエンコーダーを採用し、すべてのNARモデルの性能を向上させる。

実験結果

リサーチクエスチョン

  • RQ1並列な自己回帰的再スコアリングは、推論遅延を増加させることなく、非自己回帰的音声翻訳モデルの翻訳品質を顕著に向上させることができるか?
  • RQ2軽量な自己回帰的デコーダーを再スコアリングヘッドとして統合することで、NARモデルの仮説選択が改善されるか?
  • RQ3マルチマスク学習とテキスト専用NAR MTとの共同事前学習は、CMLMデコーダーの性能向上にどの程度効果的か?
  • RQ4Conformerエンコーダーのアーキテクチャは、NAR E2E-STモデルにおける翻訳品質と長時間音声に対するロバストネスをどの程度向上させるか?
  • RQ5並列AR再スコアリングを備えたNARモデルは、自己回帰的モデルに近い翻訳品質を達成しながらも、高い推論速度を維持できるか?

主な発見

  • Conformerエンコーダーを搭載したOrthros-CTCは、CPU上で3.63倍の高速化を達成しながら、自己回帰的モデルと同等のBLEUスコアを達成した。
  • 並列AR再スコアリングは、すべてのモデルと言語ペアでBLEUスコアを一貫して向上させ、長さビームサイズ $ l $ が大きくなるほどスコアの向上が顕著になった。
  • マルチマスク学習と共同NAR MT事前学習を施したOrthros-CMLMは、ベースラインCMLMから4.6ポイントのBLEUスコア向上を達成し、シーケンス知識蒸留を用いて訓練された大規模な自己回帰的モデルと同等の性能を示した。
  • Conformerエンコーダーは翻訳品質を顕著に向上させ、特にCTCベースのモデルにおいて顕著であり、長時間音声(最大60秒)に対してもロバストネスを向上させた。30秒を超える長さの音声では、自己回帰的モデルを上回る性能を示した。
  • オラクルBLEUスコアは、反復的リファインメントよりも並列AR再スコアリングがより高い上限スコアを達成できることを示し、NAR仮説の探索性が優れていることを示した。
  • 並列AR再スコアリングの有効性は、異なるエンコーダーおよびデコーダーのアーキテクチャ間でも維持されており、汎用性が確認された。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。