Skip to main content
QUICK REVIEW

[論文レビュー] Selective Listening by Synchronizing Speech with Lips

Zexu Pan, Ruijie Tao|arXiv (Cornell University)|Jun 14, 2021
Speech and Audio Processing被引用数 4
ひとこと要約

本論文は、事前登録された音声リファレンスを必要とせず、唇の動きを視覚的アトラクターとして用いる自己教師付き音声・視覚的スピーカー抽出モデルを提案する。音声と唇の同期を自己教師付き事前学習信号として活用することで、再入力モデルは、視覚的遮断やクロスドメイン条件下でも最先端の性能を達成する。

ABSTRACT

A speaker extraction algorithm seeks to extract the speech of a target speaker from a multi-talker speech mixture when given a cue that represents the target speaker, such as a pre-enrolled speech utterance, or an accompanying video track. Visual cues are particularly useful when a pre-enrolled speech is not available. In this work, we don't rely on the target speaker's pre-enrolled speech, but rather use the target speaker's face track as the speaker cue, that is referred to as the auxiliary reference, to form an attractor towards the target speaker. We advocate that the temporal synchronization between the speech and its accompanying lip movements is a direct and dominant audio-visual cue. Therefore, we propose a self-supervised pre-training strategy, to exploit the speech-lip synchronization cue for target speaker extraction, which allows us to leverage abundant unlabeled in-domain data. We transfer the knowledge from the pre-trained model to the attractor encoder of the speaker extraction network. We show that the proposed speaker extraction network outperforms various competitive baselines in terms of signal quality, perceptual quality, and intelligibility, achieving state-of-the-art performance.

研究の動機と目的

  • 単一チャネル音声分離におけるコctail party問題を、事前登録された音声リファレンスを必要とせずに解決すること。
  • 視覚的ヒント(特に唇の動き)を、スピーカー抽出における強力でリアルタイムな聴覚的注意のアトラクターとして活用すること。
  • 音声と唇の同期に基づく自己教師付き事前学習戦略を構築し、大規模なラベルなしドメイン内データを活用すること。
  • 視覚的入力が信頼性が低いか不一致する状況下、視覚的遮断やクロスデータセットのシナリオにおける一般化性能を向上させること。
  • エデルマンの再入力理論にインspiredされた深層学習フレームワークで、音声と視覚ストリームを同期させ、人間の再入力に基づくクロスモーダル注意を模倣すること。

提案手法

  • ラベルなしでペア化されていないデータから、音声と唇の同期を自己教師付き事前学習信号として用いることで、強力な音声・視覚表現を学習する自己教師付き事前学習戦略を提案する。
  • エデルマンの再入力理論にインspiredされた再入力モデルを設計し、双方向アテンションメカニズムによって音声と視覚ストリームを動的に同期化する。
  • 事前登録された音声信号の代わりに、ターゲットスピーカーの顔トラックを補助リファレンス(アトラクター)として使用することで、人間-ロボットインタラクションにおけるリアルタイムで自己登録可能な仕組みを実現する。
  • 事前学習済み音声・視覚モデルから、スピーカー抽出ネットワークのアトラクターエンコーダーへの知識を転移させ、ターゲットスピーカーの分離を向上させる。
  • U-Netに類似たアーキテクチャを用いた時間領域の音声分離により、ターゲットスピーカーの音声を再構築しながら、聴取品質を保持する。
  • トレーニング中に顔トラックをランダムに黒くすることで、視覚的遮断をシミュレートするデータ拡張戦略を導入し、トラッキング障害に対する耐性を向上させる。

実験結果

リサーチクエスチョン

  • RQ1音声と唇の同期は、ラベル付き音声リファレンスを必要とせず、スピーカー抽出モデルの事前学習に自己教師付き信号として利用可能か?
  • RQ2事前登録された音声が存在しない状況下で、視覚的顔トラックがターゲットスピーカー抽出のアトラクターとしてどれほど有効か?
  • RQ3顔が部分的または完全に隠された視覚的遮断下でも、再入力モデルの性能がどの程度維持されるか?
  • RQ4スタジオ録音されたデータからワイルドで制約のない動画データへのドメイン間で、モデルの一般化性能はどの程度か?
  • RQ5本手法は、信号品質、識別性、聴取品質の観点から、既存のスピーカー抽出ベースラインを上回るか?

主な発見

  • 遮断データで学習した場合、VoxCeleb2-2mix-occlテストセットで10.27 dBのSI-SDRiと0.909のPESQを達成し、すべてのベースラインを上回った。
  • 有効な視覚的期間が10%(発話全体の10%が顔が露出)の状況下でも、再入力モデルはほぼ7 dBのSI-SDRiを達成し、部分的遮断に対する耐性を示した。
  • LRS2およびLRS3のワイルド動画データセットでは、再入力モデルが12.66 dBのSI-SDRiと1.036のPESQを達成し、すべての指標でTDSE-IとMuSE-Iを上回った。
  • GridおよびTCD-TIMITのスタジオデータセットでは、再入力モデルが14.96 dBのSI-SDRiと1.118のPESQを達成し、強いクロスドメイン一般化性能を示したが、GridではMuSE-IがSI-SDRiおよびPESQでわずかに優れていた。
  • 遮断データで学習したモデルは、そうでないモデルよりも顕著に一般化性能が高く、すべての評価設定で再入力モデルが最大の性能差を維持した。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。