[論文レビュー] Synchronous Speech Recognition and Speech-to-Text Translation with Interactive Decoding
本論文は、相互作用的で同期的なエンドツーエンドモデルを提案し、音声認識(ASR)と音声翻訳(ST)を統合的に処理する。相互作用的アテンション機構により、両タスク間で双方向の情報フローを実現する。各タスクが相手の出力結果に注目できる待機-$k$ポリシーを採用することで、ASRおよびSTの両方の性能が向上し、パrameter数を増加させることなく、複数の言語ペアにおいてTED音声翻訳ベンチマークで最先端の結果を達成した。
Speech-to-text translation (ST), which translates source language speech into target language text, has attracted intensive attention in recent years. Compared to the traditional pipeline system, the end-to-end ST model has potential benefits of lower latency, smaller model size, and less error propagation. However, it is notoriously difficult to implement such a model without transcriptions as intermediate. Existing works generally apply multi-task learning to improve translation quality by jointly training end-to-end ST along with automatic speech recognition (ASR). However, different tasks in this method cannot utilize information from each other, which limits the improvement. Other works propose a two-stage model where the second model can use the hidden state from the first one, but its cascade manner greatly affects the efficiency of training and inference process. In this paper, we propose a novel interactive attention mechanism which enables ASR and ST to perform synchronously and interactively in a single model. Specifically, the generation of transcriptions and translations not only relies on its previous outputs but also the outputs predicted in the other task. Experiments on TED speech translation corpora have shown that our proposed model can outperform strong baselines on the quality of speech translation and achieve better speech recognition performances as well.
研究の動機と目的
- エンドツーエンド音声翻訳におけるパイプライン型およびマルチタスク学習手法の限界を解決すること。これらは誤り伝搬、タスク間の情報共有不足、非効率性に起因する。
- 認識と翻訳を逐次処理する二段階モデルの非効率性を克服すること。これにより推論が遅延し、双方向情報フローが制限される。
- 単一のモデル内で、同時かつ相互に作用する形で字幕と翻訳を生成すること。相互監視により、ASRおよびSTの品質が向上する。
- 遅延と性能のバランスを取る待機-$k$ポリシーを設計すること。翻訳がより多くの字幕文脈にアクセスできる一方で、リアルタイム処理能力を維持する。
- 統合学習と相互作用的アテンションが、パイプライン型、エンドツーエンド型、マルチタスク型、二段階型の強力なベースラインを上回ることを実証すること。
提案手法
- ASRデコーダーがSTの出力にも注目できる相互作用的アテンション機構を導入。STデコーダーは音声エンコーダーとASRによって生成された字幕にも注目できる。逆にASRデコーダーもSTの出力に注目できる。
- 両タスクに共通するエンコーダーを採用。ASRとSTの別個のデコーダーが、各デコーディングステップで相互作用的アテンションを通じて隠れ状態を交換する。
- 待機-$k$ポリシーを適用。STデコーダーはASRデコーダーから$k$ステップ遅れて出力を生成することで、翻訳時により多くの字幕語にアクセスできる。
- 共有エンコーダーを用いたマルチタスク学習を採用。標準的なマルチタスク学習とは異なり、アテンションを通じてデコーダー間で動的かつ双方向の情報交換が可能となる。
- ASRとSTの目的関数を統合したジョイント損失関数を用いてエンドツーエンドで学習。ビームサーチデコーディングにより、両タスクの同期を維持する。
- 両方の出力が同期的かつ交互に生成されるように、制約付きデコーディング戦略を採用する。
実験結果
リサーチクエスチョン
- RQ1ASRとSTの間で双方向の情報フローを実現することで、標準的なマルチタスク学習を上回る性能向上が可能か?
- RQ2待機-$k$ポリシーを用いた同期的で相互作用的なデコーディングは、認識性能を劣化させることなく翻訳品質を向上させるか?
- RQ3パイプライン型や二段階型システムと比較して、単一モデルが同時に字幕と翻訳を生成する際、より効率的か?
- RQ4待機-$k$ポリシーは、エンドツーエンドSTにおける遅延と翻訳品質のトレードオフにどのように影響するか?
- RQ5相互作用的アテンションは、独立したASRまたはSTモデルと比較して、誤り伝搬をどの程度軽減できるか?
主な発見
- 提案された相互作用的学習モデルは、4つの言語ペア(英語-ドイツ語、英語-フランス語、英語-中国語、英語-日本語)において、音声認識および音声翻訳の両タスクで最先端の性能を達成。パイプライン型、エンドツーエンド型、マルチタスク型、二段階型のベースラインをすべて上回った。
- 待機-$k$ポリシーにおいて$k=3$が最良の全体的性能を示し、英語-中国語翻訳タスクでベースラインのエンドツーエンドモデルと比較してBLEUスコアが最大2.1向上した。
- パrameter数は61.2Mを維持し、エンドツーエンド型およびマルチタスク型と同等のまま、二段階型モデルよりも顕著に高速な推論速度(11.98 vs. 7.44文/秒)を達成した。
- 相互作用的モデルの学習速度は1秒あたり4.23ステップであり、二段階型モデル(1.13ステップ/秒)よりも速く、エンドツーエンド型モデルと同等の速度であった。
- 事例研究では、モデルが「the biggest challenges」や「brainstormed on solutions」のような複雑なフレーズを正しく字幕化・翻訳できた。一方、ベースラインは誤認識や誤った翻訳により失敗した。
- 相互的な文脈を活用することで誤り伝搬を低減した。字幕の情報が翻訳を支援し、翻訳の情報が認識を導く。特に音声認識が曖昧な状況下で顕著に効果を示した。
より良い研究を、今すぐ始めましょう
論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。
クレジットカード登録不要
このレビューはAIが作成し、人間の編集者が確認しました。