Skip to main content
QUICK REVIEW

[論文レビュー] Wav2vec-Switch: Contrastive Learning from Original-noisy Speech Pairs for Robust Speech Recognition

Yiming Wang, Jinyu Li|arXiv (Cornell University)|Oct 11, 2021
Speech Recognition and Synthesis被引用数 6
ひとこと要約

本稿では、オリジナル音声とノイズあり音声のペアを同時に学習する新しい対照学習目的を用いて、ノイズに強い音声表現を向上させる自己教師あり学習手法 wav2vec-Switch を提案する。トレーニング中にオリジナル入力とノイズあり入力の間で量子化済みターゲットを交換することで、一貫性がありノイズに依存しない表現を学習する。合成ノイズあり LibriSpeech では相対 WER を 2.9–4.9% 減少させ、実データの CHiME-4 では 5.7% 減少させ、データ拡張ベースラインを上回り、専用の強化モジュールを搭載したシステムと同等またはそれを上回る性能を達成した。

ABSTRACT

The goal of self-supervised learning (SSL) for automatic speech recognition (ASR) is to learn good speech representations from a large amount of unlabeled speech for the downstream ASR task. However, most SSL frameworks do not consider noise robustness which is crucial for real-world applications. In this paper we propose wav2vec-Switch, a method to encode noise robustness into contextualized representations of speech via contrastive learning. Specifically, we feed original-noisy speech pairs simultaneously into the wav2vec 2.0 network. In addition to the existing contrastive learning task, we switch the quantized representations of the original and noisy speech as additional prediction targets of each other. By doing this, it enforces the network to have consistent predictions for the original and noisy speech, thus allows to learn contextualized representation with noise robustness. Our experiments on synthesized and real noisy data show the effectiveness of our method: it achieves 2.9--4.9% relative word error rate (WER) reduction on the synthesized noisy LibriSpeech data without deterioration on the original data, and 5.7% on CHiME-4 real 1-channel noisy data compared to a data augmentation baseline even with a strong language model for decoding. Our results on CHiME-4 can match or even surpass those with well-designed speech enhancement components.

研究の動機と目的

  • 外部モジュールを追加せずに、自動音声認識(ASR)のための自己教師あり音声表現学習におけるノイズ耐性を向上させること。
  • 既存の自己教師ありモデルが事前学習時にノイズを明示的に扱わないという限界を是正すること。
  • ペaired のオリジナルおよびノイズあり音声入力に基づく対照学習を通じて、耐性を高める手法を開発すること。
  • 複雑な音声強調モジュールを搭載したシステムと同等またはそれ以上の性能を達成すること、かつラベルなしデータのみを用いること。

提案手法

  • 本手法は、1つのバッチ内でオリジナル音声とノイズあり音声のペアを wav2vec 2.0 ネットワークに同時に供給する。
  • マスクされた表現に対して標準の対照損失を適用するが、新規のターゲットスイッチング機構を導入する:オリジナル音声とノイズあり音声の量子化済みターゲットを正例として入れ替える。
  • これにより、モデルはオリジナル版とノイズあり版の両方に対して一貫した予測を出力するよう強制され、ノイズに依存しない表現が促進される。
  • 元の対照損失とスイッチドターゲット対照損失を組み合わせたトレーニング目的関数を定義するが、ネットワークアーキテクチャの変更は行わない。
  • 同じドロップアウトマスクとマスクされた位置を、オリジナル-ノイズありペア間で維持することで、一貫性のある学習を保証する。
  • モデルは 960 時間分のラベルなし LibriSpeech および MUSAN データで事前学習され、その後 CTC を用いて ASR 用に微調整される。
Fig. 1 : This figure illustrates how the 4 contrastive losses are calculated in the proposed wav2vec-Switch model. The original-noisy pair of speech is fed into the network with identical internal states simultaneously. The loss quantities $\mathcal{L}^{\mathrm{C}}(C,\widetilde{Q})$ and $\mathcal{L}
Fig. 1 : This figure illustrates how the 4 contrastive losses are calculated in the proposed wav2vec-Switch model. The original-noisy pair of speech is fed into the network with identical internal states simultaneously. The loss quantities $\mathcal{L}^{\mathrm{C}}(C,\widetilde{Q})$ and $\mathcal{L}

実験結果

リサーチクエスチョン

  • RQ1オリジナル-ノイズあり音声ペアにおける対照学習は、自己教師あり ASR モデルのノイズ耐性を向上させ得るか?
  • RQ2オリジナル音声とノイズあり音声表現の間で予測の一貫性を強制することで、ノイズ環境下での一般化性能が向上するか?
  • RQ3ターゲットスイッチングのような単純でアーキテクチャに依存しない手法が、実世界のノイズあり ASR において複雑な音声強調パイプラインを上回るか?
  • RQ4本手法は、ノイズ条件が不一致である状況や、強力な言語モデルを用いた場合にどのように性能を発揮するか?

主な発見

  • 合成ノイズあり LibriSpeech データにおいて、強力な言語モデルを用いても、データ拡張ベースラインと比較して相対 WER を 2.9–4.9% 減少させた。
  • 実際の 1 チャネル CHiME-4 データでは、同じベースラインを 5.7% 相対的に上回り、専用の強化モジュールを搭載したシステムをも凌駆した。
  • クリーンなテストデータセットでも優れた性能を維持しており、元の(クリーンな)音声データに対して性能の低下が見られなかった。
  • アブレーションスタディにより、ペア間で同一のドロップアウトマスクとマスク位置を保持することが重要であることが確認され、それらのずれは顕著な WER の悪化を引き起こした。
  • 音声強調コンponents を一切使用せず、ラベルなしデータでの自己教師あり事前学習のみで、CHiME-4 で最先端の結果を達成した。
  • 言語モデルを用いない状況でも、wav2vec-Switch は合成ノイズありデータで WER を 7.1–11.0% 減少させ、強い耐性を示した。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。