Skip to main content
QUICK REVIEW

[論文レビュー] Disentangling Voice and Content with Self-Supervision for Speaker Recognition

Tianchi Liu, Kong Aik Lee|arXiv (Cornell University)|Oct 2, 2023
Speech Recognition and Synthesis被引用数 5
ひとこと要約

本稿では、3つのガウス推論層と強化された遷移モデルを用いて話者特徴と音声コンテンツを分離する自己教師付き分離フレームワークRecXiを提案する。話者IDラベルのみを活用し、テキストアノテーションや追加モデルを回避することで、VoxCelebおよびSITWにおいてそれぞれ平均9.56%および8.24%のEERおよびminDCF低減を達成し、追加データや学習を要せず優れた話者認識性能を示している。

ABSTRACT

For speaker recognition, it is difficult to extract an accurate speaker representation from speech because of its mixture of speaker traits and content. This paper proposes a disentanglement framework that simultaneously models speaker traits and content variability in speech. It is realized with the use of three Gaussian inference layers, each consisting of a learnable transition model that extracts distinct speech components. Notably, a strengthened transition model is specifically designed to model complex speech dynamics. We also propose a self-supervision method to dynamically disentangle content without the use of labels other than speaker identities. The efficacy of the proposed framework is validated via experiments conducted on the VoxCeleb and SITW datasets with 9.56% and 8.24% average reductions in EER and minDCF, respectively. Since neither additional model training nor data is specifically needed, it is easily applicable in practical use.

研究の動機と目的

  • 話者認識におけるコンテンツ変動が正確な話者表現学習を妨げるという課題に対処すること。
  • テキストラベルを必要とせず、音声内の静的(話者関連)および動的(コンテンツ関連)成分を分離する分離フレームワークを構築すること。
  • 話者IDの監督のみを用いて、動的コンテンツ分離を促進する自己教師学習損失を設計すること。
  • 事前学習済みASRモデルやマルチタスク学習の計算的・データ的負荷を回避する軽量で実用的なソリューションを構築すること。
  • 再帰的遷移機構による時系列動的要因のモデリングを通じて、話者埋め込みの品質を向上させること。

提案手法

  • フレームワークは3つのガウス推論層を用いる:最初の層が粗い話者表現を学習し、2番目の層が動的遷移モデルを用いてコンテンツを分離し、3番目の層がコンテンツを参照に話者埋め込みを精緻化する。
  • 複雑な音声動的要因を捉えるために、強化された遷移モデルを導入し、コンテンツ関連成分の分離を向上させる。
  • 独自の損失 $\mathcal{L}_{\rm ssp}$ を用いて自己教師学習を実施し、テキストアノテーションを一切使用せず、話者IDのみを用いてコンテンツ分離をガイドする。
  • 学習可能な遷移機構を採用し、潜在要因を通じて静的(話者)および動的(コンテンツ)成分を両方モデリングする。
  • 静的層では話者分類損失、コンテンツ分離では自己教師学習を用いてエンドツーエンドで学習し、ラベルなしのコンテンツモデリングを可能にする。
  • 動的成分は、時間に依存する遷移層 $\mathbf{G}_{t}$ を介してモデリングされ、多様な音声変動を捉えるために複数のマイクロ遷移モデルが使用される。

実験結果

リサーチクエスチョン

  • RQ1テキストラベルや外部ASRモデルを一切使用せずに、話者表現を音声コンテンツから効果的に分離できるか?
  • RQ2話者IDのみが利用可能な状況で、自己教師学習をどのように活用し、コンテンツ分離を促進できるか?
  • RQ3強化された遷移モデルを備えた3層ガウス推論アーキテクチャは、標準的手法に比べて話者認識性能を向上させるか?
  • RQ4提案された自己教師学習損失 $\mathcal{L}_{\rm ssp}$ は、分離精度および下流の認識精度をどの程度向上させるか?
  • RQ5追加のモデルやデータ要件なしに、実世界の展開に適した軽量かつ実用的なフレームワークを構築できるか?

主な発見

  • 提案されたRecXiフレームワークは、ベースライン手法と比較してVoxCelebデータセットで平均9.56%のEER低減を達成した。
  • SITWデータセットでは、平均8.24%のminDCF低減を達成し、一貫した性能向上を示した。
  • 自己教師学習損失 $\mathcal{L}_{\rm ssp}$ は、すべてのRecXiシステムで平均5.07%/5.44%のEER/minDCF低減をもたらし、その有効性を裏付けた。
  • $\tilde{\phi}$ と $\tilde{\phi}_{\rm lin}$ の両方の特徴を用いるシステムは、$\tilde{\phi}$ のみを用いる場合よりも優れた性能を示し、特に自己教師学習が適用された場合には顕著だった。
  • $\mathcal{L}_{\rm ssp}$ を適用することで、異なる特徴設定間の性能差が縮小したため、分離の安定化および向上に寄与していることが示された。
  • アブレーションスタディにより、提案された $\mathbf{G}_{t}$ 遷移層が音声内の動的成分をモデリングするために有効かつ不可欠であることが確認された。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。