Skip to main content
QUICK REVIEW

[論文レビュー] Decision Attentive Regularization to Improve Simultaneous Speech Translation Systems

Mohd Abbas Zaidi, Beomseok Lee|arXiv (Cornell University)|Oct 13, 2021
Natural Language Processing Techniques参考文献 20被引用数 4
ひとこと要約

本論文は、同時翻訳(SimulST)の性能を向上させるための意思決定注意正則化(DAR)を提案する。DARは、同時テキスト翻訳(SimulMT)モデルから得られる単調的注意エネルギーを活用し、読込/書込意思決定ポリシーを最適化する。DARは遅延を低減しつつ翻訳品質を向上させ、MuST-C En-De データセットにおける複数の遅延レジームでベースライン比34.66%の相対的改善(4.5 BLEUポイント)を達成した。

ABSTRACT

Simultaneous translation systems start producing the output while processing the partial source sentence in the incoming input stream. These systems need to decide when to read more input and when to write the output. These decisions depend on the structure of source/target language and the information contained in the partial input sequence. Hence, read/write decision policy remains the same across different input modalities, i.e., speech and text. This motivates us to leverage the text transcripts corresponding to the speech input for improving simultaneous speech-to-text translation (SimulST). We propose Decision Attentive Regularization (DAR) to improve the decision policy of SimulST systems by using the simultaneous text-to-text translation (SimulMT) task. We also extend several techniques from the offline speech translation domain to explore the role of SimulMT task in improving SimulST performance. Overall, we achieve 34.66% / 4.5 BLEU improvement over the baseline model across different latency regimes for the MuST-C English-German (EnDe) SimulST task.

研究の動機と目的

  • 音声入力の複雑さに起因する、同時翻訳(SimulST)システムにおける読込/書込意思決定ポリシーの改善。
  • 同時にテキスト翻訳(SimulMT)モデルから得られる意思決定が、SimulSTの指導信号として機能するかを調査すること。
  • オフライン音声翻訳技術(マルチタスク学習、オンライン知識蒸留(KD)、クロス注意正則化(CAR)など)を、同時翻訳設定に拡張すること。
  • 音声とテキスト入力間の単調的注意エネルギーを一致させるためのクロスモーダル正則化機構を構築し、意思決定ポリシー学習を向上させること。
  • 推論遅延を増加させることなく、SimulSTにおける顕著な性能向上を達成すること。

提案手法

  • DARは、自己注意およびクロス注意演算を用いて、音声(SimulST)とテキスト(SimulMT)入力の単調的注意エネルギー行列を共有空間に投影することで、クロスモーダル類似度を計算する。
  • 再構築された注意表現(A^{s→t} と A^{t→t})間のL2距離を用いて類似度を測定し、共同学習中に乖離を最小化する。
  • 提案された損失関数は、単調的マルチヘッド注意(MMA)を用いて、シグモイド変換された注意エネルギーを通じて離散的読込/書込意思決定を学習するMMAベースのSimulSTモデルの学習に統合される。
  • 本手法は、マルチタスク学習、オンラインKD、CAR、データ拡張と組み合わせられ、SimulSTおよびSimulMTの目的関数を同時に最適化する。
  • モデルはMuST-C En-De データセット上でエンドツーエンドに訓練され、意思決定ポリシー学習を支援するために、訓練中に注意エネルギーの整合性が強制される。
  • 最終的なモデル、MMA-DARは、すべてのコンポONENT(データ拡張、マルチタスク学習、オンラインKD、CAR、DAR)を統合し、最適なパフォーマンスを達成する。

実験結果

リサーチクエスチョン

  • RQ1SimulMTから学習した意思決定ポリシーは、SimulSTモデルの性能向上に寄与するか?
  • RQ2音声とテキスト入力間の単調的注意エネルギーを一致させることで、SimulSTにおける読込/書込意思決定が改善されるか?
  • RQ3オフラインST技術(例:オンラインKD、CAR)は、同時に翻訳設定にどの程度一般化可能か?
  • RQ4クロスモーダル注意正則化は、推論遅延を増加させることなく、SimulSTにおける遅延-品質トレードオフを軽減できるか?
  • RQ5DARによる性能向上は、異なる遅延レジームにおいて統計的に有意か?

主な発見

  • DARは、MuST-C En-De テストセットにおける複数の遅延レジームで、ベースラインMMAモデル比4.5 BLEUポイントの向上を達成した。
  • 34.66%の相対的改善は、すべての遅延レベルで一貫しており、0.7~1.2 BLEUポイントの向上が確認された。
  • DARに加え、データ拡張、マルチタスク学習、オンラインKD、CARを統合した最終的なMMA-DARモデルは、MuST-C En-De テストセットで22.35 BLEUを達成した。
  • DAR単体による向上は、ペアドt検定により99%信頼水準で統計的に有意(p = 0.002)であった。
  • すべての評価ポイントでベースラインより低い遅延を維持しており、MMA-DARは同等または低遅延でより高いBLEUスコアを達成した。
  • DARによる向上は、入力レベルの正則化(例:CAR)よりも顕著に大きく、意思決定ポリシーの正則化が特徴量レベルの蒸留よりも効果的であることが示された。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。