Skip to main content
QUICK REVIEW

[論文レビュー] UniSpeech-SAT: Universal Speech Representation Learning with Speaker Aware Pre-Training

Sanyuan Chen, Yu Wu|arXiv (Cornell University)|Oct 12, 2021
Speech Recognition and Synthesis被引用数 9
ひとこと要約

本稿では、HuBERTフレームワークに発話単位の対照的損失と発話混合データ拡張戦略を統合することで、話者に配慮した事前学習を強化する自己教師あり音声表現モデル、UniSpeech-SATを提案する。この手法は、SUPERBベンチマークにおける話者指向タスクで最先端の性能を達成し、特に話者ダイアライゼーションと識別において、ダイアライゼーション誤り率が25%相対的に低減された。一方で、ASR性能は維持されている。

ABSTRACT

Self-supervised learning (SSL) is a long-standing goal for speech processing, since it utilizes large-scale unlabeled data and avoids extensive human labeling. Recent years witness great successes in applying self-supervised learning in speech recognition, while limited exploration was attempted in applying SSL for modeling speaker characteristics. In this paper, we aim to improve the existing SSL framework for speaker representation learning. Two methods are introduced for enhancing the unsupervised speaker information extraction. First, we apply the multi-task learning to the current SSL framework, where we integrate the utterance-wise contrastive loss with the SSL objective function. Second, for better speaker discrimination, we propose an utterance mixing strategy for data augmentation, where additional overlapped utterances are created unsupervisely and incorporate during training. We integrate the proposed methods into the HuBERT framework. Experiment results on SUPERB benchmark show that the proposed system achieves state-of-the-art performance in universal representation learning, especially for speaker identification oriented tasks. An ablation study is performed verifying the efficacy of each proposed method. Finally, we scale up training dataset to 94 thousand hours public audio data and achieve further performance improvement in all SUPERB tasks.

研究の動機と目的

  • 事前学習モデルにおける話者アイデンティティの識別を明示的に向上させることにより、自己教師あり音声表現学習を改善すること。
  • 従来のSSLフレームワークが主に音声コンテンツの最適化に特化しているという限界を是正すること。
  • 教師付き話者ラベルが不要な状態で、無教師事前学習が話者情報をより良く保持できるかを調査すること。
  • マルチタスク学習とデータ拡張が、コンテンツベースの性能を損なわせることなく話者表現を向上させる有効性を評価すること。

提案手法

  • 発話単位の対照的損失を事前学習目的に統合し、集約された発話埋め込みと話者別擬似ラベルを用いて話者識別を向上させる。
  • ランダムな発話を組み合わせることで部分的に重複する訓練サンプルを生成する発話混合戦略を提案し、話者重複に強い耐性を付与する。
  • 提案手法をHuBERTフレームワーク内に適用し、マスク予測を主なSSL目的としつつ、話者に配慮した教師信号を追加する。
  • ベースHuBERTモデルの6層目からのクラスタリングに基づく擬似ラベルを用いて、事前学習のターゲットを生成する。
  • LibriVox、GigaSpeech、VoxPopuliを含む大規模な無教師音声データで学習を行い、最大モデルでは合計94k時間のデータを用いる。
  • コンテンツ表現と話者表現の両方を同時に最適化するため、対照的損失とマスク予測損失を組み合わせたマルチタスク学習目的を採用する。
Fig. 1 : An illustration of our method. We conduct contrastive loss in the intermediate layer, and use mixed utterance as input.
Fig. 1 : An illustration of our method. We conduct contrastive loss in the intermediate layer, and use mixed utterance as input.

実験結果

リサーチクエスチョン

  • RQ1教師付き話者ラベルが不要な状態で、自己教師あり事前学習を話者アイデンティティの把握を強化するために改善できるか?
  • RQ2発話単位の対照的学習を追加することで、事前学習モデルにおける話者表現品質はどのように向上するか?
  • RQ3発話混合をデータ拡張戦略として用いることで、話者重複への耐性と話者識別性能はどの程度向上するか?
  • RQ4話者表現の向上が、音声認識(ASR)などのコンテンツベースタスクの性能を損なうことはないか?
  • RQ594k時間にまで拡大された事前学習データが、多様な音声タスクにおける性能に与える影響は何か?

主な発見

  • UniSpeech-SATモデルは、94k時間データセット上でのダイアライゼーション誤り率(DER)が5.88%から3.80%に低下し、25%の相対的低減を達成した。
  • 94k時間設定では、話者識別精度が97.40%(DER 3.80%)に向上し、HuBERT Baseベースラインを大きく上回った。
  • 感情認識タスクでは68.48%の精度を達成し、ベースラインと比較して顕著な向上を示し、副言語的特徴の表現が向上したことを示した。
  • 話者タスクでの性能向上にもかかわらず、大規模モデルでは言語モデル(LM)なしで9%のWER増加を示したが、ベースモデルではその差は2%未満にまで縮まった。
  • アブレーションスタディにより、発話対照的損失と発話混合の両方が性能向上に顕著に寄与しており、20%の混合比が話者とコンテンツの性能のバランスを最適化するのに適していることが判明した。
  • 重み解析の結果、浅い層が話者タスクに寄与する割合が高く、上位層はコンテンツおよび意味的タスクに重要であることが確認され、モデルが階層的表現を学習していることが裏付けられた。
Fig. 2 : Weight Analysis.
Fig. 2 : Weight Analysis.

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。