Skip to main content
QUICK REVIEW

[論文レビュー] UniSpeech: Unified Speech Representation Learning with Labeled and Unlabeled Data

Chengyi Wang, Yu Wu|arXiv (Cornell University)|Jan 19, 2021
Speech Recognition and Synthesis参考文献 41被引用数 20
ひとこと要約

UniSpeechは、ラベル付きおよびラベルなしデータを用いて、教師あり音声的CTC学習と音声に配慮した対照的自己教師付き学習を統合的に最適化する統一された事前学習フレームワークを提案する。マスクされたトークン置換を用いて量子化器にSR固有の表現を明示的にガイドすることで、UniSpeechは、教師あり転移学習と比較して最大26.9%、自己教師付き学習と比較して13.4%の相対的発話誤り率の低減を達成し、多言語およびドメインシフトされた音声認識で最先端の性能を発揮する。

ABSTRACT

In this paper, we propose a unified pre-training approach called UniSpeech to learn speech representations with both unlabeled and labeled data, in which supervised phonetic CTC learning and phonetically-aware contrastive self-supervised learning are conducted in a multi-task learning manner. The resultant representations can capture information more correlated with phonetic structures and improve the generalization across languages and domains. We evaluate the effectiveness of UniSpeech for cross-lingual representation learning on public CommonVoice corpus. The results show that UniSpeech outperforms self-supervised pretraining and supervised transfer learning for speech recognition by a maximum of 13.4% and 17.8% relative phone error rate reductions respectively (averaged over all testing languages). The transferability of UniSpeech is also demonstrated on a domain-shift speech recognition task, i.e., a relative word error rate reduction of 6% against the previous approach.

研究の動機と目的

  • ラベル付きおよびラベルなしデータを活用することで、低リソース音声認識の課題に対処すること。
  • 音声に配慮した表現を学習することで、言語およびドメイン間での一般化を向上させること。
  • コードブックの崩壊を緩和し、離散的潜在ユニットと音声ユニットの整合性を向上させること。
  • より良い表現学習を実現するため、教師あり学習と自己教師付き学習をマルチタスクフレームワークで統合すること。
  • 事前学習モデルの低リソースおよびドメイン外設定への転送性を強化すること。

提案手法

  • UniSpeechは、畳み込み特徴抽出器、Transformerエンコーダー、および学習可能な量子化器を備えたモデルアーキテクチャを用い、離散的潜在表現を生成する。
  • ラベル付きデータに対しては、文脈的表現を音素ラベルと整合させるためのシーケンスレベルのCTC損失を適用する。
  • 一定割合の文脈的表現を量子化された表現に置き換えるマスク置換戦略を導入し、量子化器が音声ユニットに明示的にガイドされるようにする。
  • ラベルなしデータに対しては、マスクされた表現と離散的コードを用いて対照的学習を適用し、表現品質を向上させる。
  • モデルは、ラベル付きの高リソースデータとラベルなしの低リソースデータを同時に事前学習し、その後、小規模なラベル付き低リソースデータで微調整する。
  • 活性なコードワード数と整合性エントロピーの最適化により、多様で音声に意味のあるコードワードを生成するように量子化器を訓練する。

実験結果

リサーチクエスチョン

  • RQ1教師ありCTC学習と対照的自己教師付き学習を統合することで、音声表現の質が向上するか?
  • RQ2量子化器を音声ユニットに明示的にガイドすることで、コードブックの多様性が向上し、音素との整合性が高まるか?
  • RQ3純粋に自己教師付き学習または教師あり事前学習と比較して、UniSpeechは多言語音声認識でどのように性能を発揮するか?
  • RQ4UniSpeechはドメインシフトされた音声認識タスクに効果的に一般化できるか?
  • RQ5最適なパフォーマンスを達成するためのハイパーパrameter設定(例:置換確率、損失重み)は何か?

主な発見

  • UniSpeechは、多言語音声認識タスクにおいて、教師あり転移学習と比較して最大26.9%の相対的発話誤り率の低減を達成した。
  • CommonVoiceベンチマークでは、自己教師付き事前学習と比較して13.4%の相対的誤り率低減を達成した。
  • XLSRと比較して、25,743の活性コードワードを有するより多様なコードブックを学習しており、音声クラスタリングの質が向上していることが示された。
  • 平均整合性エントロピーが0.83であるのに対し、XLSRでは1.34であったため、離散的ユニットが音素とより正確に整合していることが示された。
  • 文脈的表現の50%(r=0.5)を量子化されたものに置換した場合が最良のパフォーマンスを示し、r=0では相対的に7.8%の性能低下が生じた。
  • ドメインシフトされたLibrispeechからTedlium3への転移タスクでは、6%の相対的単語誤り率低減を達成した。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。