Skip to main content
QUICK REVIEW

[論文レビュー] Multi-stage Speaker Extraction with Utterance and Frame-Level Reference Signals

Meng Ge, Chenglin Xu|arXiv (Cornell University)|Nov 19, 2020
Speech and Audio Processing参考文献 16被引用数 5
ひとこと要約

この論文では、短いリファレンス音声でも性能を向上させるために、発話レベルおよびフレームレベルのスピーカー埋め込みをリファレンス信号として活用する、マルチステージ型スピークァー抽出モデルSpEx++を提案する。抽出された音声を第二のリファレンスとして繰り返しスピークァー表現を精緻化し、学習可能な重みを用いてマルチスケール出力を融合することで、SpEx++はWSJ0-2mixおよびノイジーなベンチマーク(WHAM!、WHAMR!)で最先端の性能を達成し、2秒間のリファレンス音声のみを用いても、先行手法よりも最大1.0 dBのSI-SDRi向上を達成した。

ABSTRACT

Speaker extraction requires a sample speech from the target speaker as the reference. However, enrolling a speaker with a long speech is not practical. We propose a speaker extraction technique, that performs in multiple stages to take full advantage of short reference speech sample. The extracted speech in early stages is used as the reference speech for late stages. For the first time, we use frame-level sequential speech embedding as the reference for target speaker. This is a departure from the traditional utterance-based speaker embedding reference. In addition, a signal fusion scheme is proposed to combine the decoded signals in multiple scales with automatically learned weights. Experiments on WSJ0-2mix and its noisy versions (WHAM! and WHAMR!) show that SpEx++ consistently outperforms other state-of-the-art baselines.

研究の動機と目的

  • 短いリファレンス音声しか利用できない状況でのスピークァー抽出性能の悪化という課題に対処すること。
  • 発話レベルのスピークァー埋め込みのみをリファレンスとして使用する単一ステージモデルの制限を克服すること。
  • 特に困難なスピークァー抽出が求められるノイジーでリバーブの強い環境における耐性および性能の向上。
  • マルチスケール出力を自動的に統合する信号融合機構の開発により、最終的な音声品質の向上。
  • 抽出された音声を第二のリファレンス信号として繰り返し精緻化することで、より良い性能が得られることを実証すること。

提案手法

  • 各ステージが直前のステージで抽出されたターゲット音声を新たなリファレンス信号として使用するマルチステージアーキテクチャを提案する。
  • ターゲットスピーカーの音声の時間的ダイナミクスを捉えるために、フレームレベルの逐次的スピークァー埋め込みを第二のリファレンス信号として導入する。
  • 学習可能な重みを用いてマルチスケールで復元された出力を統合する信号融合戦略を採用し、より高品質な最終出力を得る。
  • 混合音声とリファレンス音声を同じ潜在空間に写像するために、重みを共有する二重の音声エンコーダーを用いる。
  • 発話レベルおよびフレームレベルの埋め込みを併用して、スケールに特化したマスクを推定し、ターゲット音声の再構成を実現するスピークァー抽出器を適用する。
  • スピークァー予測のための交差エントロピー損失と、信号再構成のためのマルチスケールSI-SDR損失を組み合わせたマルチタスク目的関数でモデルを訓練する。

実験結果

リサーチクエスチョン

  • RQ1短いリファレンス音声しか利用できない状況でも、マルチステージ型スピークァー抽出フレームワークが性能向上をもたらすか?
  • RQ2発話レベルの埋め込みに加えて、フレームレベルの逐次的スピークァー埋め込みをリファレンス信号として用いることで、より優れた抽出性能が得られるか?
  • RQ3初期ステージで抽出された音声を第二のリファレンス信号として用いることで、スピークァー表現学習が向上するか?
  • RQ4学習可能な信号融合機構は、マルチスケール出力を統合することで、音声品質の向上にどの程度有効か?
  • RQ5提案手法は、条件固有の再トレーニングを必要とせず、ノイジーおよびリバーブ環境に広く一般化できるか?

主な発見

  • 2秒間のリファレンス音声のみを用いても、SpEx+ベースラインに対して1.0 dBのSI-SDRi向上を達成し、最小限のリファレンス入力でも優れた性能を示した。
  • 2段階のSpEx++は、フレームレベルのスピークァー埋め込みと信号融合の導入により、1段階のSpEx+よりもSDRiおよびSI-SDRiで0.3 dB優れた性能を達成した。
  • 学習可能な重み(w1=1.18, w2=0.32, w3=0.11)を用いた信号融合戦略により、高分解能の信号をより重視することで性能が向上した。
  • WHAM!およびWHAMR!データセットでは、ノイジーおよびリバーブ環境下で、それぞれ0.9 dBおよび0.5 dBの絶対的SI-SDRi向上をSpEx+に対して達成した。
  • クリア、ノイジー、リバーブ、ノイジー・リバーブの4つの条件でトレーニングした汎用的なSpEx++モデルは、良好な一般化性能を示し、ノイジー混合音で14.6 dB、リバーブ混合音で11.2 dB、ノイジー・リバーブ混合音で11.6 dBのSI-SDRiを達成した。
  • 3段階バージョンは2段階バージョンに対してわずかな向上を示し、発話レベルおよびフレームレベルのリファレンスからの重複情報が2段階以上で顕著に減少するため、段階数の増加に伴い利得が減少することが示された。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。