Skip to main content
QUICK REVIEW

[論文レビュー] Personal VAD: Speaker-Conditioned Voice Activity Detection

Shaojin Ding, Quan Wang|arXiv (Cornell University)|Aug 12, 2019
Speech Recognition and Synthesis参考文献 30被引用数 8
ひとこと要約

本稿では、スフィア埋め込みで条件付けられた軽量な、話者に依存する音声活動検出(VAD)システム「Personal VAD」を提案する。130Kパラメータのニューラルネットワークを用い、音声フレームを非音声、ターゲット話者の音声、非ターゲット話者の音声の3クラスに分類する。標準のVAD+話者認証ベースラインを上回り、オンデバイスで低遅延・低消費電力な音声認識を、ターゲットユーザーが話している場合にのみトリガー可能にする。

ABSTRACT

In this paper, we propose "personal VAD", a system to detect the voice activity of a target speaker at the frame level. This system is useful for gating the inputs to a streaming on-device speech recognition system, such that it only triggers for the target user, which helps reduce the computational cost and battery consumption, especially in scenarios where a keyword detector is unpreferable. We achieve this by training a VAD-alike neural network that is conditioned on the target speaker embedding or the speaker verification score. For each frame, personal VAD outputs the probabilities for three classes: non-speech, target speaker speech, and non-target speaker speech. Under our optimal setup, we are able to train a model with only 130K parameters that outperforms a baseline system where individually trained standard VAD and speaker recognition networks are combined to perform the same task.

研究の動機と目的

  • ターゲット話者が発話している場合にのみ音声認識をトリガーするリアルタイムでオンデバイスに実装可能な音声活動検出システムを開発すること。
  • 分離されたVADと話者認証モデルを組み合わせる手法の限界を解消し、高い遅延と計算オーバーヘッドを回避すること。
  • 非音声、ターゲット話者の音声、非ターゲット話者の音声を区別する軽量なフレーム単位の推論モデルを設計すること。
  • 最小限のモデルサイズで話者固有の音声活動を学習することで、騒音環境やマルチスピーク環境における耐性を高めること。
  • ウェイクワード検出の必要性を排除することで、キーワードフリーな音声アシスタントとのシームレスな連携を実現すること。

提案手法

  • 音声特徴量とターゲット話者埋め込みを入力とし、非音声、ターゲット話者の音声、非ターゲット話者の音声を予測する3クラスのフレーム単位分類モデルを提案する。
  • 2層のLSTMネットワーク(64ユニット)と最終的な全結合層を用い、初期の3クラス分類を目的とした交差エントロピー損失で学習する。
  • 非音声と非ターゲット話者の音声を区別する重み付きペairワイズ損失関数を導入し、ターゲット話者の音声と非音声、非ターゲット話者の音声を区別する重要性を高める一方で、非音声と非ターゲット話者の音声の区別に対する重みを低減する。
  • 話者アイデンティティを符号化するd-vector話者埋め込みモデル(8言語で微調整)を用い、推論時に条件入力として使用する。
  • モデルサイズ(0.13Mパラメータ)を最小限に抑え、リアルタイムでフレーム単位の処理を可能にすることで、推論コストを最適化する。
  • 増強されたLibriSpeechデータセット上での平均適合率(AP)を用い、マルチターン認識(MTR)有無の両方で性能を評価する。
Figure 1: The speaker verification system [ 13 ] produces an utterance-level d-vector by aggregating window-level embeddings.
Figure 1: The speaker verification system [ 13 ] produces an utterance-level d-vector by aggregating window-level embeddings.

実験結果

リサーチクエスチョン

  • RQ11つの軽量ニューラルネットワークが、標準のVADと話者認証モデルの連鎖処理を上回り、ターゲット話者の音声活動を検出できるか?
  • RQ2特に重み付きペアワイズ損失関数を用いることで、モデルのターゲット話者の音声と非音声、非ターゲット話者の音声を区別する能力にどのような影響を与えるか?
  • RQ3ターゲット話者検出に最適化された個人用VADモデルが、標準のVADタスク(音声/非音声検出)においても性能を維持できる範囲はどの程度か?
  • RQ4オンデバイスでリアルタイムに動作する話者に依存するVADにおいて、モデルサイズ、推論速度、正確性の最適なトレードオフは何か?
  • RQ5話者埋め込みで条件付けられたVADは、騒音環境やマルチスピーク環境において、誤検出と見逃しのレートを顕著に改善できるか?

主な発見

  • 埋め込み条件付きトランスフォーマー(ET)アーキテクチャは、MTRなしで0.932 mAP、MTRありで0.878 mAPを達成し、わずか0.13百万パラメータで、ベースライン話者認証モデルの40分の1のサイズであった。
  • 重み付きペアワイズ損失は標準の交差エントロピー損失を上回り、最適な性能はw<ns,ntss> = 0.1で達成され、非音声と非ターゲット話者の音声の混同が低減したが、全体の正確性は劣化しなかった。
  • Personal VADモデルは、音声検出においてCE損失で0.991、重み付きペアワイズ損失で0.991のAPスコアを達成し、標準VADモデル(0.992)と同等の性能を示した。これは、標準VADタスクにおける性能劣化が最小限であることを裏付けた。
  • ETモデルはMTRありで非音声(ns)で0.893 mAP、非ターゲット話者の音声(ntss)で0.901 mAPを達成し、3クラスすべてにわたる優れた一般化性能を示した。
  • 提案されたPersonal VADシステムは、正確性と効率性の両面で、標準のVADと話者認証モデルの連鎖処理ベースラインを上回った。特にリソースが限られたオンデバイス環境において顕著な優位性を示した。
  • 結果から、Personal VADは、モデルサイズや計算コストを増加させることなく、従来のVADを後続のASRシステムで置き換え可能であり、ターゲット話者専用のアクティベーションを可能にすることが確認された。
Figure 2: Four different architectures to implement personal VAD: (a) SC : Run standard VAD and frame-level speaker verification independently, and combine their results. This is used as a baseline for other aproaches. (b) ST : Concatenate frame-level speaker verification score with acoustic feature
Figure 2: Four different architectures to implement personal VAD: (a) SC : Run standard VAD and frame-level speaker verification independently, and combine their results. This is used as a baseline for other aproaches. (b) ST : Concatenate frame-level speaker verification score with acoustic feature

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。