Skip to main content
QUICK REVIEW

[論文レビュー] Wav2Seq: Pre-training Speech-to-Text Encoder-Decoder Models Using Pseudo Languages

Felix F. Wu, Kwangyoun Kim|arXiv (Cornell University)|May 2, 2022
Speech Recognition and Synthesis被引用数 5
ひとこと要約

Wav2Seqは、音声を離散的な疑似サブワードトークンに変換する疑似ASRタスクを定式化することで、音声-to-テキストモデルにおけるエンコーダーとデコーダーの共同事前学習を自己教師付き手法で実現する。この手法は、追加のテキストデータがなくても、エンド・ツー・エンドの話者固有名前抽出(SNER)で最先端の結果を達成し、音声-to-テキスト翻訳において20の言語対で一貫した性能向上を実現する。また、低リソースASR環境下でも、エンコーダー・デコーダー型モデルとCTCモデルの性能差を縮小する。

ABSTRACT

We introduce Wav2Seq, the first self-supervised approach to pre-train both parts of encoder-decoder models for speech data. We induce a pseudo language as a compact discrete representation, and formulate a self-supervised pseudo speech recognition task -- transcribing audio inputs into pseudo subword sequences. This process stands on its own, or can be applied as low-cost second-stage pre-training. We experiment with automatic speech recognition (ASR), spoken named entity recognition, and speech-to-text translation. We set new state-of-the-art results for end-to-end spoken named entity recognition, and show consistent improvements on 20 language pairs for speech-to-text translation, even when competing methods use additional text data for training. Finally, on ASR, our approach enables encoder-decoder methods to benefit from pre-training for all parts of the network, and shows comparable performance to highly optimized recent methods.

研究の動機と目的

  • 自己教師付き事前学習における不均衡を是正する。一般的にはエンコーダーのみが事前学習されるが、デコーダーはランダムに初期化されたり、NLPモデルから借用されたりする。
  • アライメント済みテキストを必要とせず、生の音声のみを用いて、音声-to-テキストモデルにおけるエンコーダーとデコーダーの両方をエンド・ツー・エンドで事前学習可能にする。
  • 特に、従来CTCベースのモデルに比べて性能が劣りがちな、シーケンス・ツー・シーケンス型モデルの低リソース環境下での性能向上を図る。
  • 離散的でコンパクトな疑似言語表現が、両者を共同で事前学習する有効な自己教師付きターゲットとして機能できることを示す。
  • 既存の事前学習済みエンコーダー(例:HuBERT や XLS-R)の性能を最小限の追加コストで向上させる、柔軟で低コストの2段階目事前学習手法を提供する。

提案手法

  • ベクトル量子化とクラスタリングアルゴリズムを用いて、生の音声表現を離散的なサブワード単位にクラスタリングすることで、疑似言語を生成する。
  • モデルが生の音声を疑似サブワードトークンの系列に変換する自己教師付き疑似ASRタスクを定式化する。
  • この疑似ASR目的関数を用いて、交差エントロピー損失を疑似トークンに適用することで、エンコーダー・デコーダー全体をエンド・ツー・エンドで事前学習する。
  • 実際の言語埋め込み(例:英語のサブワードや文字)に入力および出力の埋め込み層を置き換えることで、下流タスクで微調整する。
  • HuBERT や XLS-R などの既存の事前学習済みエンコーダーの上に、この手法を2段階目の事前学習ステップとして適用し、最小限の追加コストで性能を向上させる。
  • 長さ圧縮と重複除去技術を用いて、意味的関連性とシーケンス効率の両立を図った、コンパクトで意味のある疑似サブワード系列を生成する。
Figure 1: Pseudo ASR task. The Wav2Seq model is pre-trained to transcribe an audio input into a sequence of pseudo language tokens. The embedding layers are replaced during fine-tuning on real ASR or speech translation tasks. “ $<$ sos $>$ ” is the start-of-sequence token and “ $<$ eos $>$ ” is the
Figure 1: Pseudo ASR task. The Wav2Seq model is pre-trained to transcribe an audio input into a sequence of pseudo language tokens. The embedding layers are replaced during fine-tuning on real ASR or speech translation tasks. “ $<$ sos $>$ ” is the start-of-sequence token and “ $<$ eos $>$ ” is the

実験結果

リサーチクエスチョン

  • RQ1音声-to-テキストモデルにおけるエンコーダーとデコーダーの両方を共同で事前学習することで、エンコーダーのみを事前学習する場合に比べて性能が向上するか?
  • RQ2離散的な疑似サブワードをターゲットとする自己教師付き疑似ASRタスクが、テキストの監視なしに効果的な事前学習を可能にするか?
  • RQ3Wav2Seqは低リソース環境下で、CTCベースのモデルや外部言語モデルを搭載したモデルと比較して、どのように性能を発揮するか?
  • RQ4Wav2Seqは、HuBERT や XLS-R などの既存の事前学習済みエンコーダーの性能を向上させる低コストの2段階目事前学習手法として機能できるか?
  • RQ5疑似サブワード表現の選択(例:重複除去、BPE)が、下流タスクの性能にどの程度影響を与えるか?

主な発見

  • SLUE-VoxPopuli SNERベンチマークにおいて、HuBERT-largeで初期化されたWav2Seqは、評価されたすべてのモデルの中でエンド・ツー・エンド性能が最高であった。
  • 音声-to-テキスト翻訳において、Wav2Seqは20の言語対でHuBERT や XLS-R で初期化されたモデルを上回り、追加の機械翻訳データで訓練されたモデルと同等の性能を達成した。
  • 低リソースASR(ラベル付きデータ10時間)環境下では、Wav2Seqがエンコーダー・デコーダー型モデルとCTCモデルの性能差を縮小し、特に後者の性能を顕著に向上させた。
  • 2段階目事前学習として適用した場合、Wav2SeqはHuBERT-largeベースのモデルが低リソースおよび高リソースのSTタスクで性能向上を示し、2~3倍大きなエンコーダーを持つモデルをも凌駆した。
  • 疑似ASRタスクでは、LibriSpeech dev-otherで38.1%のWERを達成し、長さ圧縮率が17.4%であった。これはBPEや文字レベルのターゲットを上回る性能を示した。
  • アブレーションスタディの結果、重複除去とBPEベースのサブワードトークン化が性能向上に不可欠であり、生の文字に比べてWERを6.0ポイント低下させた。
Figure 2: Mapping an audio input into pseudo subwords. Here we use the first 0.6 seconds of a real audio from LibriSpeech [ 41 ] training set as an example. We use models with 25 clusters and 1000 BPE tokens in this example. Pseudo subword is a compact representation (in terms of the sequence length
Figure 2: Mapping an audio input into pseudo subwords. Here we use the first 0.6 seconds of a real audio from LibriSpeech [ 41 ] training set as an example. We use models with 25 clusters and 1000 BPE tokens in this example. Pseudo subword is a compact representation (in terms of the sequence length

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。