Skip to main content
QUICK REVIEW

[論文レビュー] SPIRAL: Self-supervised Perturbation-Invariant Representation Learning for Speech Pre-Training

Wenyong Huang, Zhenhe Zhang|arXiv (Cornell University)|Jan 25, 2022
Speech Recognition and Synthesis被引用数 7
ひとこと要約

SPIRALは、モーメンタム更新された教師ネットワークからのクリアな表現に基づいて、学生ネットワークが摂動に影響されない表現を学ぶように訓練する教師-学生フレームワークを用いた自己教師付き音声事前学習手法を提案する。この手法は、65–80%低い訓練コストでwav2vec 2.0と同等またはそれ以上の性能を達成し、多条件事前学習によりノイズ耐性が著しく向上し、実際のノイズ混在音声データ上でWERが9.0–13.3%低減される。

ABSTRACT

We introduce a new approach for speech pre-training named SPIRAL which works by learning denoising representation of perturbed data in a teacher-student framework. Specifically, given a speech utterance, we first feed the utterance to a teacher network to obtain corresponding representation. Then the same utterance is perturbed and fed to a student network. The student network is trained to output representation resembling that of the teacher. At the same time, the teacher network is updated as moving average of student's weights over training steps. In order to prevent representation collapse, we apply an in-utterance contrastive loss as pre-training objective and impose position randomization on the input to the teacher. SPIRAL achieves competitive or better results compared to state-of-the-art speech pre-training method wav2vec 2.0, with significant reduction of training cost (80% for BASE model, 65% for LARGE model). Furthermore, we address the problem of noise-robustness that is critical to real-world speech applications. We propose multi-condition pre-training by perturbing the student's input with various types of additive noise. We demonstrate that multi-condition pre-trained SPIRAL models are more robust to noisy speech (9.0% - 13.3% relative word error rate reduction on real noisy test data), compared to applying multi-condition training solely in the fine-tuning stage. Source code is available at https://github.com/huawei-noah/Speech-Backbones/tree/main/SPIRAL.

研究の動機と目的

  • 訓練コストを低減しつつノイズ耐性を向上させる、より効率的で強力な音声事前学習手法の開発。
  • モーメンタム更新された教師ネットワークからのクリアな表現を用いて、学生ネットワークが摂動に影響されない表現を学ぶように訓練すること。
  • ベクトル量子化や反復的クラスタリングに依存しないように、文脈内対照学習を用いた単一の対照損失を用いること。
  • 多条件事前学習により、多様なノイズタイプを用いて事前学習することで、現実世界の音声認識性能を向上させること。
  • 文脈内対照損失と入力位置のランダム化により、表現の崩壊や位置情報の不正利用を防ぐこと。

提案手法

  • 教師ネットワークがクリアな音声を処理し、学生ネットワークが同じ発話の摂動を加えたバージョンを処理する教師-学生フレームワーク。
  • 教師ネットワークは、訓練ステップにわたる学生の重みの移動平均を用いて更新され、安定したターゲット表現を保証する。
  • 同じ発話内の異なるセグメント間の表現の多様性を促進することで、表現の崩壊を防ぐために文脈内対照損失が適用される。
  • 教師の入力にランダムなパディングを両端に追加することで、位置情報の崩壊を防ぐために位置ランダム化が適用される。
  • ノイズ耐性を向上させるために、事前学習中に学生の入力にさまざまな加法的ノイズタイプを適用することで多条件事前学習が実装される。
  • 計算コストを低減しつつ性能劣化を最小限に抑えるために、SPIRALモデルで段階的なダウンサンプリング戦略が用いられる。

実験結果

リサーチクエスチョン

  • RQ1教師-学生 distillation を用いた自己教師付き事前学習手法が、wav2vec 2.0 などの最先端手法と同等の性能を達成しつつ、訓練コストを低く抑えることができるか?
  • RQ2多様なノイズ条件で事前学習することで、多条件データでの微調整のみに比べて、現実のノイズ混在音声に対する耐性がより高くなるか?
  • RQ3文脈内対照損失と位置ランダム化が、順序的な音声表現における表現の崩壊や位置情報の不正利用を効果的に防げるか?
  • RQ4ベクトル量子化やクラスタリング手順を排除することで、音声表現学習におけるモデル性能と訓練効率にどのような影響が生じるか?
  • RQ5教師ネットワークに計算ノイズ(例:ドロップアウト、LayerDrop)を適用することで、一般化性能と耐性がどの程度向上するか?

主な発見

  • SPIRAL は LibriSpeech の test-clean で WER 3.5%、test-other で 6.4% を達成し、wav2vec 2.0 と同等またはそれ以上の性能を示したが、ベースモデルでは80%、ラージモデルでは65%の訓練コスト削減が達成された。
  • 多様なノイズタイプを用いた多条件事前学習により、実際のノイズ混在 CHiME-3 テストデータ上で WER が相対的に 9.0–13.3% 低減され、微調整段階での多条件学習のみに比べて優れた性能を示した。
  • 教師の入力に摂動を加えると性能が著しく低下することが確認され、効果的なデノイジングを実現するため、教師をクリアな入力に保つ設計選択が妥当であることが裏付けられた。
  • 教師に計算ノイズ(例:ドロップアウト、LayerDrop)を適用することで、相対的 WER が 15.9% 減少し、一般化性能の向上が示された。
  • 予測器を削除した場合、畳み込み型プロジェクションヘッドが性能向上に寄与したため、予測器とプロジェクションヘッドの間に機能的類似性があるが、相補的ではないことが示唆された。
  • 位置ランダム化は、表現学習における頑健性と安定性の向上により、位置情報の崩壊を効果的に防止することが実証された。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。