Skip to main content
QUICK REVIEW

[論文レビュー] Self-supervised Pre-training Reduces Label Permutation Instability of Speech Separation.

Sung-Feng Huang, Shun-Po Chuang|arXiv (Cornell University)|Oct 29, 2020
Speech Recognition and Synthesis参考文献 29被引用数 7
ひとこと要約

この論文では、多話者状況における音声分離のラベル順序の不安定性、特に順序不変訓練(PIT)におけるラベル順序の不安定性を安定化させるために自己教師あり事前学習を提案する。音声強調に基づく事前学習を活用することで、訓練時間を最大で3分の2まで短縮しつつ、性能を維持する。特にバッチサイズが大きい場合に顕著である。

ABSTRACT

Speech separation has been well-developed while there are still problems waiting to be solved. The main problem we focus on in this paper is the frequent label permutation switching of permutation invariant training (PIT). For N-speaker separation, there would be N! possible label permutations. How to stably select correct label permutations is a long-standing problem. In this paper, we utilize self-supervised pre-training to stabilize the label permutations. Among several types of self-supervised tasks, speech enhancement based pre-training tasks show significant effectiveness in our experiments. When using off-the-shelf pre-trained models, training duration could be shortened to one-third to two-thirds. Furthermore, even taking pre-training time into account, the entire training process could still be shorter without a performance drop when using a larger batch size.

研究の動機と目的

  • 多話者音声分離における順序不変訓練(PIT)における継続的なラベル順序の不安定性の問題に対処すること。
  • 自己教師あり事前学習が、N人の話者分離におけるN!通りの可能なラベル順序のうち正しい順序の選択を安定化させられるかどうかを調査すること。
  • モデルの性能を維持または向上させながら、音声分離の訓練時間を短縮すること。
  • 特に音声強調に基づく手法を含む、さまざまな自己教師あり事前学習タスクの有効性を評価すること。

提案手法

  • 下流の分離タスクにおける微調整の前に、音声分離モデルに自己教師あり事前学習を適用すること。
  • さまざまな自己教師あり目的の中でも、音声強調に基づく事前学習タスクが最も効果的であることを特定すること。
  • 順序不変訓練(PIT)を用いて、事前学習済みモデルを音声分離タスクで微調整すること。
  • 収束を加速し、訓練時間を短縮するために、市販の事前学習済みモデルを活用すること。
  • 微調整時により大きなバッチサイズを採用することで、事前学習時間も含めて、訓練時間をさらに短縮すること。

実験結果

リサーチクエスチョン

  • RQ1自己教師あり事前学習は、多話者音声分離におけるラベル順序の不安定性を低減できるか?
  • RQ2どのタイプの自己教師あり事前学習タスクが、音声分離におけるラベル順序の安定化に最も効果的か?
  • RQ3事前学習は、音声分離モデルの総合訓練時間をどの程度短縮できるか?
  • RQ4訓練時間を短縮した場合、事前学習はモデルの性能を維持または向上させられるか?

主な発見

  • 自己教師あり事前学習、特に音声強調に基づくタスクは、音声分離におけるラベル順序の不安定性を顕著に低減する。
  • 事前学習済みモデルを用いることで、訓練時間が元の1/3から2/3にまで短縮される。
  • 事前学習時間も含めて、大きなバッチサイズを用いた場合、ベースラインの訓練時間よりも短い総合訓練時間が得られる。
  • 事前学習済みモデルと大きなバッチサイズを用いることで、性能が劣化せずに維持される。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。