Skip to main content
QUICK REVIEW

[論文レビュー] Deep Extractor Network for Target Speaker Recovery From Single Channel Speech Mixtures

Jun Wang, Jie Chen|arXiv (Cornell University)|Jul 24, 2018
Speech and Audio Processing参考文献 15被引用数 13
ひとこと要約

本稿では、1秒未塔の非常に短いアンカーアウトプット(1秒未塔)を用いて、1チャンネル混合音声から高品質なターゲット話者の音声を回復するためのデュープル・エクストラクターネットワーク(DENet)を提案する。相対的話者情報を符号化する安定したキャノニカル埋め込み空間を学習することで、DENetはベースラインモデルよりもSDRで5.2%、PESQで6.6%の向上を達成し、1人以上の干渉話者が存在する混合音声に対しても効果的に一般化できる。

ABSTRACT

Speaker-aware source separation methods are promising workarounds for major difficulties such as arbitrary source permutation and unknown number of sources. However, it remains challenging to achieve satisfying performance provided a very short available target speaker utterance (anchor). Here we present a novel "deep extractor network" which creates an extractor point for the target speaker in a canonical high dimensional embedding space, and pulls together the time-frequency bins corresponding to the target speaker. The proposed model is different from prior works in that the canonical embedding space encodes knowledges of both the anchor and the mixture during an end-to-end training phase: First, embeddings for the anchor and mixture speech are separately constructed in a primary embedding space, and then combined as an input to feed-forward layers to transform to a canonical embedding space which we discover more stable than the primary one. Experimental results show that given a very short utterance, the proposed model can efficiently recover high quality target speech from a mixture, which outperforms various baseline models, with 5.2% and 6.6% relative improvements in SDR and PESQ respectively compared with a baseline oracle deep attracor model. Meanwhile, we show it can be generalized well to more than one interfering speaker.

研究の動機と目的

  • 非常に短い適応発話(例:1秒未塔)を用いた1チャンネル混合音声からのターゲット話者抽出の課題に対処すること。
  • 既存の話者に依存するモデルが長時間の適応セグメント(例:約10秒)を必要としているという制限を克服すること。
  • 相対的話者情報を符号化するキャノニカル埋め込み空間を導入することで、話者埋め込み空間の安定性と性能を向上させること。
  • 再トレーニングなしに、1人以上の干渉話者が存在する混合音声に対しても一般化できるようにすること。
  • 将来の話者に依存しないアンカー学習への拡張を可能にする統合フレームワークの開発

提案手法

  • 共有エンコーダーネットワークを用いて、アンカー発話および混合音声の主な埋め込みを構築する。
  • アンカーと混合音声の埋め込みをフィードフォワードネットワークで統合し、高次元のキャノニカル埋め込み空間を形成する。
  • 時間周波数チャンネルのターゲット話者を引き寄せる、相対的情報に基づく安定した抽出ポイントをキャノニカル空間で学習する。
  • 予測値と正例音声の再構成誤差を最小化する微分可能な損失関数を用い、エンド・ツー・エンドの学習を可能にする。
  • 人間の聴覚認識にインspiredされたアテンションベースの制御原理を用いて、抽出ポイントの形成をガイドする。
  • 教師あり混合音声ラベルとアンカー発話を用いて、エンド・ツー・エンドにモデルを学習させ、未観測の話者数に対しても頑健な一般化を実現する。

実験結果

リサーチクエスチョン

  • RQ1深層学習モデルは、1秒未塔のアンカーアウトプットのみを用いて、1チャンネル混合音声から高品質なターゲット話者音声を抽出できるか?
  • RQ2キャノニカル埋め込み空間で相対的話者情報を学習することで、絶対的埋め込みよりも安定的かつ一般化性の高い話者表現が得られるか?
  • RQ3SDRおよびPESQの観点で、本稿で提案するDENetモデルは、DANet やオラクルモデルなどの既存の話者に依存するベースラインと比較してどのように性能を発揮するか?
  • RQ42話者混合音声のみで学習したにもかかわらず、1人以上の干渉話者が存在する混合音声に対しても、モデルは効果的に一般化できるか?
  • RQ5注意に基づくフィードバック機構を用いて、DENetフレームワークを話者に依存しないアンカー学習へ拡張することは可能か?

主な発見

  • DENetは、ベースラインのオラクル・ディープ・アトラクターモデルと比較して、SDRで5.2%、PESQで6.6%の相対的向上を達成した。
  • アンカー発話が1秒未塔でさえも、モデルは高品質なターゲット話者音声を効果的に回復でき、必要な適応長が顕著に短縮された。
  • キャノニカル埋め込み空間は、主な埋め込み空間よりも安定しており、話者抽出ポイントが密にクラスタリングされ、明確に分離されていることから裏付けられた。
  • 3話者混合音声シナリオでは、DENetはすべてのベースラインを上回り、中程度の干渉条件下で13.44 dBのSDRおよび2.52のPESQを達成した。
  • DENetは、敵対的干渉条件下でも頑健に一般化し、中程度の干渉条件と比較してSDRで20%の相対的低下にとどめ、すべてのベースラインを上回った。
  • 可視化結果から、ターゲット話者埋め込みはキャノニカル抽出ポイントの周囲に密にクラスタリングされている一方で、干渉話者埋め込みは離れていることが確認され、モデルの注目メカニズムの有効性が裏付けられた。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。