Skip to main content
QUICK REVIEW

[論文レビュー] End-to-end Speech Translation via Cross-modal Progressive Training

Rong Ye, Mingxuan Wang|arXiv (Cornell University)|Apr 21, 2021
Natural Language Processing Techniques参考文献 36被引用数 8
ひとこと要約

本論文では、共有されたTransformerアーキテクチャを用いて、音声-to-テキスト翻訳(ST)、自動音声認識(ASR)、機械翻訳(MT)を統合的に学習する、クロスモーダルでエンドツーエンドの音声翻訳モデルXSTNetを提案する。自己教師ありWav2vec2.0表現、並列テキストデータを用いたマルチタスク学習、および段階的トレーニング戦略を活用することで、XSTNetはMuST-Cで平均28.8のBLEUを達成し、先行手法を3.2 BLEUポイント上回る最先端の性能を発揮した。

ABSTRACT

End-to-end speech translation models have become a new trend in research due to their potential of reducing error propagation. However, these models still suffer from the challenge of data scarcity. How to effectively use unlabeled or other parallel corpora from machine translation is promising but still an open problem. In this paper, we propose Cross Speech-Text Network (XSTNet), an end-to-end model for speech-to-text translation. XSTNet takes both speech and text as input and outputs both transcription and translation text. The model benefits from its three key design aspects: a self-supervised pre-trained sub-network as the audio encoder, a multi-task training objective to exploit additional parallel bilingual text, and a progressive training procedure. We evaluate the performance of XSTNet and baselines on the MuST-C En-X and LibriSpeech En-Fr datasets. In particular, XSTNet achieves state-of-the-art results on all language directions with an average BLEU of 28.8, outperforming the previous best method by 3.2 BLEU. Code, models, cases, and more detailed analysis are available at https://github.com/ReneeYe/XSTNet.

研究の動機と目的

  • エンドツーエンド音声翻訳におけるデータ不足問題を、ラベルなしデータおよび並列テキストデータを活用することで解決すること。
  • ST、ASR、MTタスクの統合的トレーニングにより、モデルの汎化性能を向上させ、誤差伝搬を低減すること。
  • 段階的トレーニングを実現する効果的な戦略を設計すること。
  • 自己教師あり音声表現と外部MTデータが低リソースST設定においてどのように効果を発揮するかを実証すること。

提案手法

  • XSTNetは、文脈的な音声表現を生成するため、音声エンコーダーとして自己教師ありWav2vec2.0サブネットワークを用いる。
  • モデルは、音声-to-テキスト翻訳、ASR、MTタスクの全タスクに共通のTransformerエンコーダーとデコーダーを共有することで、マルチタスク学習を可能にする。
  • 外部MT並列データ(例:WMT、OpenSubtitles)を活用して、モデルの事前学習を行い、汎化性能を向上させる。
  • 段階的マルチタスクトレーニング手順を採用し、外部MTデータでの事前学習の後、ST、ASR、MTの監視信号を統合的に微調整する。
  • モデルは音声またはテキスト入力を受容し、同時に字幕と翻訳出力を生成するため、全タスクの共同最適化が可能になる。
  • Wav2vec2.0の後に2つの1次元畳み込み層を追加し、シーケンス長を短縮するとともに、音声とテキストのシーケンス次元を一致させる。
Figure 1: The model structure of XSTNet. It accepts either audio or text input. For the audio input, we deploy wav2vec2.0 followed by two convolution layers to get the audio embedding. The Transformer encoder and decoder are shared for both modalities.
Figure 1: The model structure of XSTNet. It accepts either audio or text input. For the audio input, we deploy wav2vec2.0 followed by two convolution layers to get the audio embedding. The Transformer encoder and decoder are shared for both modalities.

実験結果

リサーチクエスチョン

  • RQ1ST、ASR、MTの統合的マルチタスク学習は、低リソース音声翻訳において性能向上をもたらすか?
  • RQ2Wav2vec2.0を用いた自己教師あり事前学習は、エンドツーエンドSTにおけるデータ要件を低減するのにどの程度効果的か?
  • RQ3外部MTデータを用いた段階的トレーニングは、STモデルの収束性と汎化性能を向上させるか?
  • RQ4大規模外部MTデータを統合することで、ST性能はどの程度向上するか?

主な発見

  • XSTNetはMuST-Cデータセットで平均28.8の新しいSOTA BLEUスコアを達成し、前回の最良手法を3.2 BLEUポイント上回った。
  • 外部WMTデータでの事前学習により1.2 BLEU向上を達成し、大規模MT事前学習の有効性を示した。
  • 初期段階のデータを微調整中に保持する段階的トレーニングは、より良い性能をもたらし、段階的トレーニングの利点を裏付けた。
  • ST、ASR、MTを同時に微調整するマルチタスク微調整は、ST専用微調整よりも優れた結果をもたらし、モデルのロバストネス向上を示した。
  • 外部MTデータのサイズを増加させること(例:WMTからOpenSubtitlesに)により、MuST-C En-DeでST BLEUが27.1から27.8に上昇し、データ規模の影響を示した。
  • 特に低リソース設定において、XSTNetはSTデータでのみ学習されたモデルに比べ、収束が早く、汎化性能も優れている。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。