Skip to main content
QUICK REVIEW

[論文レビュー] MAM: Masked Acoustic Modeling for End-to-End Speech-to-Text Translation

Junkun Chen, Mingbo Ma|arXiv (Cornell University)|Oct 22, 2020
Natural Language Processing Techniques参考文献 41被引用数 14
ひとこと要約

本論文は、音声データの字幕なしでエンドツーエンド音声翻訳(E2E-ST)を可能にする自己教師付き事前学習手法であるマスク音声モデリング(MAM)を提案する。MAMは、文脈情報を用いてマスクされた音声セグメントを再構築するように音声エンコーダーを学習させ、字幕なしでベースライン比平均で+2.3 BLEUの向上を達成する。また、音楽や動物の鳴き声などの非音声データで事前学習しても性能が向上する。

ABSTRACT

End-to-end Speech-to-text Translation (E2E-ST), which directly translates source language speech to target language text, is widely useful in practice, but traditional cascaded approaches (ASR+MT) often suffer from error propagation in the pipeline. On the other hand, existing end-to-end solutions heavily depend on the source language transcriptions for pre-training or multi-task training with Automatic Speech Recognition (ASR). We instead propose a simple technique to learn a robust speech encoder in a self-supervised fashion only on the speech side, which can utilize speech data without transcription. This technique termed Masked Acoustic Modeling (MAM), not only provides an alternative solution to improving E2E-ST, but also can perform pre-training on any acoustic signals (including non-speech ones) without annotation. We conduct our experiments over 8 different translation directions. In the setting without using any transcriptions, our technique achieves an average improvement of +1.1 BLEU, and +2.3 BLEU with MAM pre-training. Pre-training of MAM with arbitrary acoustic signals also has an average improvement with +1.6 BLEU for those languages. Compared with ASR multi-task learning solution, which replies on transcription during training, our pre-trained MAM model, which does not use transcription, achieves similar accuracy.

研究の動機と目的

  • 既存のエンドツーエンド音声翻訳(E2E-ST)モデルが、事前学習やマルチタスク学習のための大規模な字幕付き音声データに依存している問題に対処すること。
  • 生の、字幕のない音声および任意の音響信号(例:音楽、動物の鳴き声)を活用して、強力な音声エンコーダーを事前学習する自己教師付き手法を開発すること。
  • 字幕なしでの事前学習が、ASRマルチタスク学習などの字幕依存手法と同等またはそれを上回る性能を達成できることを実証すること。
  • 字幕が入手不可能または極めて高価な低リソース・ゼロリソース環境においても、効果的な事前学習を可能にすること。

提案手法

  • MAMは、事前学習中に入力音声スペクトログラムのランダムなセグメントをマスクし、文脈的情報を用いて元のマスクされたセグメントを再構築するようにモデルを学習する。
  • 再構築目的は、テキストや字幕の監視なしに、音声モダリティのみに適用される。
  • 事前学習済みのMAMモデルは、追加の字幕データでの微調整なしに、エンドツーエンドで音声翻訳に微調整可能である。
  • MAMは任意のE2E-STモデルアーキテクチャと互換性があり、既存の事前学習やマルチタスク学習戦略と組み合わせて使用可能である。
  • 本手法は汎用的である:人間の言語に限らず、多言語音声、音楽、動物の発声など、任意の音響信号で事前学習可能である。
  • モデルは標準的なシーケンス・ツー・シーケンスフレームワークを採用し、予測されたマスクされた音声フレームと元のフレームとの間のMSE損失を最小化する。

実験結果

リサーチクエスチョン

  • RQ1字幕が不要な自己教師付き音声事前学習手法が、エンドツーエンド音声翻訳の性能を向上させられるか?
  • RQ2MAM事前学習は、音楽や動物の鳴き声などの非音声音響信号にどの程度一般化可能か?
  • RQ3翻訳精度の観点から、MAMはASR事前学習やMTLなどの字幕依存型事前学習と比べてどうか?
  • RQ4MAMは、字幕データが一切存在しない低リソースまたはゼロリソース環境でも強力な性能を発揮できるか?
  • RQ5MAM事前学習により、高価な字幕作成の必要性を減らしつつ、翻訳品質を維持または向上させられるか?

主な発見

  • 字幕なしのゼロトランスクリプション環境では、MAMは8つの翻訳方向全体でベースライン比平均で+1.09 BLEUの向上を達成した。
  • MAM事前学習により、モデルは字幕なしでベースライン比平均で+2.26 BLEUの向上を達成し、顕著に優れた性能を示した。
  • 任意の音響信号(例:音楽、動物の発声)で事前学習した場合でも、MAMは平均で+1.6 BLEUの向上を達成し、人間の言語を超えた一般化を示した。
  • 低リソース設定(50時間の学習データ)において、MAMは字幕なしでLibri-Lightで事前学習したが、ASRマルチタスク学習で微調整されたモデルと同等の性能を達成した。
  • たとえ50時間の学習データのみで、微調整段階で字幕なしでも、MAMは非音声音声で事前学習した結果、フランス語→英語翻訳で6.84 BLEUを達成し、ベースラインE2E-STモデル(0.52 BLEU)を上回った。
  • 英語データでMAM事前学習を施すと、英語→フランス語翻訳で31.2 BLEU(ベースライン31.2)にまで向上し、最小限の監視情報でも顕著な向上が得られた。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。