Skip to main content
QUICK REVIEW

[論文レビュー] Semi-supervised Time Domain Target Speaker Extraction with Attention

Zhepei Wang, Ritwik Giri|arXiv (Cornell University)|Jun 18, 2022
Speech Recognition and Synthesis被引用数 7
ひとこと要約

本稿では、事前学習済みのスピーカー埋め込み表現と二重パストランスフォーマーブロック内のマルチヘッドアテンション機構を活用する、時間領域に基づくトランスフォーマー型のターゲットスピーカー抽出アーキテクチャExformerを提案する。モデルは教師あり学習において最先端の性能を達成し、さらに未ラベル混合音を用いた二段階の半教師あり学習手順を適用することで、学習バッチの10%が未ラベルデータである場合、教師ありベースライン比で0.6 dBのSI-SDR向上を達成する。

ABSTRACT

In this work, we propose Exformer, a time-domain architecture for target speaker extraction. It consists of a pre-trained speaker embedder network and a separator network based on transformer encoder blocks. We study multiple methods to combine speaker information with the input mixture, and the resulting Exformer architecture obtains superior extraction performance compared to prior time-domain networks. Furthermore, we investigate a two-stage procedure to train the model using mixtures without reference signals upon a pre-trained supervised model. Experimental results show that the proposed semi-supervised learning procedure improves the performance of the supervised baselines.

研究の動機と目的

  • 時間領域のニューラルネットワークを設計し、ターゲットスピーカー抽出(TSE)に適切にスピーカー埋め込みと自己アテンション機構を統合すること。
  • トランスフォーマーに基づく分離器における、スピーカー埋め込みと混合音表現との間の統合戦略(連結、乗算、加算)の違いが性能に与える影響を調査すること。
  • 未ラベルの音声混合音を活用して、教師ありベースラインを上回るTSE性能を向上させる二段階の半教師あり学習フレームワークを検討すること。
  • 半教師あり設定において、事前学習済みスピーカー埋め込み表現に再構成損失を適用する有効性を評価すること。

提案手法

  • Exformerアーキテクチャは、登録音声から固定次元のスピーカー埋め込みを抽出するため、事前学習済みのBLSTMベースのスピーカー埋め込み表現器を用いる。
  • 分離ネットワークは二重パストランスフォーマーブロックに基づき構築され、各ブロックはセグメント化された混合音表現をマルチヘッドアテンションで処理し、要素ごとの加算、乗算、または連結によってスピーカー埋め込みを統合する。
  • マスクネットワークは、セグメンテーションモジュール、埋め込み誘導型の二重パス処理、およびオーバーラップアド再構成を用いて、時間周波数マスクを推定する。
  • 二段階の訓練手順が採用されている:第一段階では、負のSI-SDR損失を用いてラベル付きデータでモデルを学習する。第二段階では、ラベル付きデータと未ラベル混合音の組み合わせを用い、スピーカー埋め込み表現の再構成損失を適用して微調整を行う。
  • 第二段階では埋め込み損失を適用することで、スピーカー埋め込み空間を分離タスクに適合させ、未ラベルデータに対する一般化性能を向上させる。
  • スケーリングされた学習率スケジューラーを用いてモデルを訓練し、教師ありデータと疑似ラベル付きデータの組み合わせを用いる。実験では、未ラベルデータの割合を変化させて評価した。

実験結果

リサーチクエスチョン

  • RQ1スピーカー埋め込み統合戦略(連結、乗算、加算)の選択が、トランスフォーマーに基づくTSEシステムの性能に与える影響は何か?
  • RQ2参照信号のない未ラベル音声混合音を活用した場合、二段階の半教師あり学習手順がTSE性能を向上させ得るか?
  • RQ3第二段階の訓練ステージでスピーカー埋め込み表現の再構成損失を組み込むことで、未ラベルデータに対するモデルの一般化性能と性能が向上するか?
  • RQ4時間領域TSEにおける半教師あり学習の最適な未ラベルデータとラベル付きデータの比率は何か?

主な発見

  • スピーカー埋め込みの加算統合を採用したExformerが、統合方法の中で最も優れた性能を示し、教師あり学習下でSI-SDR 19.85 dB、PESQ 3.82を達成した。
  • 加算統合戦略は、乗算戦略より0.3 dB、連結戦略より0.8 dBのSI-SDR向上をもたらし、スピーカー識別子を分離器に効果的に条件づけていることを示している。
  • 10%の未ラベルデータ割合を用いた二段階の半教師あり学習手順により、教師ありベースライン(19.85 dB)比で0.6 dBのSI-SDR向上(20.21 dB)を達成し、PESQもわずかに3.83に向上した。
  • 第二段階で埋め込み損失を適用することで性能が向上したが、これは教師ありモデルからの初期化が行われた場合に限る。ランダム初期化で埋め込み損失を適用した場合、性能は劣化した。
  • 性能は10%の未ラベルデータ抽出率でピークに達し、25%や50%に増加させると性能が低下した。これは過学習やノイズの多い疑似ラベルの影響による可能性がある。
  • TseNet や SpEx+ といった先行時間領域TSE手法を上回る性能を示しており、適切な統合戦略と半教師あり学習を組み合わせたトランスフォーマー基盤アーキテクチャの優位性を確認した。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。